Mathematical Reasoning on AIME 2026 (FLOPs and avg@16 Accuracy)
15.4AIME avg@16 AccuracysGPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| sGPOModel Scale=Qwen2.5-Math-7B2026.06 | 15.4 | 1.6 | 7.3 | 8.9 | |
| DAPOModel Scale=Qwen2.5-Math-7B2026.06 | 14 | 0 | 22.3 | 22.3 | |
| Knapsack RLModel Scale=Qwen2.5-Math-7B2026.06 | 11.9 | 0 | 20.1 | 20.1 | |
| GRESOModel Scale=Qwen2.5-Math-7B2026.06 | 11.5 | 0 | 21.9 | 21.9 | |
| Knapsack RLModel Scale=Qwen2.5-Math-1.5B2026.06 | 9 | 0 | 4.7 | 4.7 | |
| sGPOModel Scale=Qwen2.5-Math-1.5B2026.06 | 8.8 | 0.4 | 1.1 | 1.5 | |
| GRESOModel Scale=Qwen2.5-Math-1.5B2026.06 | 8.5 | 0 | 4.3 | 4.3 | |
| DAPOModel Scale=Qwen2.5-Math-1.5B2026.06 | 8.1 | 0 | 4.4 | 4.4 | |
| Base modelModel Scale=Qwen2.5-Math-7B2026.06 | 7.1 | — | — | — | |
| Base modelModel Scale=Qwen2.5-Math-1.5B2026.06 | 6.7 | — | — | — |