Mathematical Reasoning on AIME 24 (Raw Score)
25ScoreMQR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MQRBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 25 | — | — | |
| MathForgeBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 24.58 | — | — | |
| DGPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 23.85 | — | — | |
| GPGBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 21.98 | — | — | |
| GRPO-ADBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 21.56 | — | — | |
| DAPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 21.25 | — | — | |
| Dr.GRPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 21.04 | — | — | |
| GRPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 20.94 | — | — | |
| GSPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 19.38 | — | — | |
| Base ModelBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 12.19 | — | — | |
| DAPOContext length=8k2025.05 | — | 54.38 | 57.4 | |
| GRPOContext length=8k2025.05 | — | 37.5 | 43.96 | |
| RPG-REINFORCE-UFKLContext length=8k2025.05 | — | 59.06 | 59.58 | |
| RPG-REINFORCE-URKLContext length=8k2025.05 | — | 57.08 | 57.81 | |
| RPG-UFKLContext length=8k2025.05 | — | 59.38 | 61.77 | |
| RPG-URKLContext length=8k2025.05 | — | 45.42 | 52.6 |