Mathematical Reasoning on AIME 2025 (Accuracy@16, FLOPs)
14.8Accuracy@16Knapsack RL
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Knapsack RLModel Scale=Qwen2.5-Math-7B2026.06 | 14.8 | 0 | 20.1 | 20.1 | |
| sGPOModel Scale=Qwen2.5-Math-7B2026.06 | 13.5 | 1.6 | 7.3 | 8.9 | |
| GRESOModel Scale=Qwen2.5-Math-7B2026.06 | 12.9 | 0 | 21.9 | 21.9 | |
| DAPOModel Scale=Qwen2.5-Math-7B2026.06 | 12.5 | 0 | 22.3 | 22.3 | |
| Knapsack RLModel Scale=Qwen2.5-Math-1.5B2026.06 | 6.8 | 0 | 4.7 | 4.7 | |
| GRESOModel Scale=Qwen2.5-Math-1.5B2026.06 | 5.8 | 0 | 4.3 | 4.3 | |
| sGPOModel Scale=Qwen2.5-Math-1.5B2026.06 | 5.8 | 0.4 | 1.1 | 1.5 | |
| Base modelModel Scale=Qwen2.5-Math-7B2026.06 | 5.4 | — | — | — | |
| DAPOModel Scale=Qwen2.5-Math-1.5B2026.06 | 4.6 | 0 | 4.4 | 4.4 | |
| Base modelModel Scale=Qwen2.5-Math-1.5B2026.06 | 4 | — | — | — |