Mathematical Reasoning on HMMT 2026 (FLOPs and Accuracy)
6.6Accuracy@16sGPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| sGPOModel Scale=Qwen2.5-Math-7B2026.06 | 6.6 | 1.6 | 7.3 | 8.9 | |
| GRESOModel Scale=Qwen2.5-Math-7B2026.06 | 6.1 | 0 | 21.9 | 21.9 | |
| Knapsack RLModel Scale=Qwen2.5-Math-7B2026.06 | 6.1 | 0 | 20.1 | 20.1 | |
| DAPOModel Scale=Qwen2.5-Math-7B2026.06 | 5.4 | 0 | 22.3 | 22.3 | |
| GRESOModel Scale=Qwen2.5-Math-1.5B2026.06 | 3.4 | 0 | 4.3 | 4.3 | |
| Knapsack RLModel Scale=Qwen2.5-Math-1.5B2026.06 | 3 | 0 | 4.7 | 4.7 | |
| sGPOModel Scale=Qwen2.5-Math-1.5B2026.06 | 2.7 | 0.4 | 1.1 | 1.5 | |
| Base modelModel Scale=Qwen2.5-Math-7B2026.06 | 2.7 | — | — | — | |
| DAPOModel Scale=Qwen2.5-Math-1.5B2026.06 | 1.7 | 0 | 4.4 | 4.4 | |
| Base modelModel Scale=Qwen2.5-Math-1.5B2026.06 | 1.5 | — | — | — |