Mathematical Reasoning on AIME 25 (Avg@32, #Token)
32.8Avg@32 ScoreGR³
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GR³Category=Performance-oriented RL2026.03 | 32.8 | 8,137 | |
| GRPOCategory=Performance-oriented RL2026.03 | 31.4 | 12,985 | |
| SFT→RLBase Model=Qwen2.5-Math-7B, Source=verl2026.04 | 29.8 | — | |
| SFTBase Model=Qwen2.5-Math-7B, Source=verl2026.04 | 28.2 | — | |
| DLER-R1-1.5BCategory=Length-oriented RL2026.03 | 27.8 | 3,153 | |
| Prefix-RFT [14]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 26.4 | — | |
| AdaptThink-1.5BCategory=Length-oriented RL2026.03 | 24.7 | 9,234 | |
| Laser-DE-L4096-1.5BCategory=Length-oriented RL2026.03 | 24.1 | 5,008 | |
| DeepSeek-R1-Distill-1.5BCategory=Initial model2026.03 | 23.6 | 15,799 | |
| LUFFY [11]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 23.1 | — | |
| ReLIFT [12]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 22.9 | — | |
| HPT [15]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 21.9 | — | |
| SRFT [13]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 21.6 | — | |
| ReLIFT [12]Base Model=Qwen2.5-Math-7B, Source=reproduction attempt2026.04 | 21 | — | |
| LCR1-1.5BCategory=Length-oriented RL2026.03 | 20.6 | 8,275 | |
| LUFFY [11]Base Model=Qwen2.5-Math-7B, Source=reproduction attempt2026.04 | 16.9 | — |