Reasoning on Overall Aggregate
90.1AccuracyS-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| S-GRPOBackbone=Qwen3-14B2026.04 | 90.1 | 3,170 | |
| VanillaBackbone=Qwen3-14B2026.04 | 88.7 | 5,062 | |
| DTSRBackbone=Qwen3-14B2026.04 | 88.7 | 3,246 | |
| RL + Length PenaltyBackbone=Qwen3-14B2026.04 | 88.6 | 3,491 |