Mathematical Reasoning on AIME 25 (Score)
12.6AIME ScoreMathForge
Evaluation Results
| Method | Links | |
|---|---|---|
| MathForgeBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 12.6 | |
| MQRBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 11.77 | |
| DGPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 10.21 | |
| GRPO-ADBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 9.48 | |
| GPGBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 9.06 | |
| DAPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 8.75 | |
| GRPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 8.44 | |
| GSPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 8.33 | |
| Dr.GRPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 8.23 | |
| Base ModelBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 4.79 |