Mathematical Reasoning on AIME 2024 (FLOPs and Accuracy@16)
31Avg@16 AccuracysGPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| sGPOModel Scale=Qwen2.5-Math-7B2026.06 | 31 | 1.6 | 7.3 | 8.9 | |
| DAPOModel Scale=Qwen2.5-Math-7B2026.06 | 29.8 | 0 | 22.3 | 22.3 | |
| Knapsack RLModel Scale=Qwen2.5-Math-7B2026.06 | 28.9 | 0 | 20.1 | 20.1 | |
| GRESOModel Scale=Qwen2.5-Math-7B2026.06 | 26.7 | 0 | 21.9 | 21.9 | |
| Base modelModel Scale=Qwen2.5-Math-7B2026.06 | 16.9 | — | — | — | |
| sGPOModel Scale=Qwen2.5-Math-1.5B2026.06 | 16.7 | 0.4 | 1.1 | 1.5 | |
| Knapsack RLModel Scale=Qwen2.5-Math-1.5B2026.06 | 16.5 | 0 | 4.7 | 4.7 | |
| DAPOModel Scale=Qwen2.5-Math-1.5B2026.06 | 15 | 0 | 4.4 | 4.4 | |
| GRESOModel Scale=Qwen2.5-Math-1.5B2026.06 | 11.5 | 0 | 4.3 | 4.3 | |
| Base modelModel Scale=Qwen2.5-Math-1.5B2026.06 | 9.4 | — | — | — |