Mathematical Reasoning on AIME24 (Acc@16, Tokens)
24.58Acc@16+CurES-GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| +CurES-GRPOBase Model=Qwen2.5-Math-7B, Training Method=CurES-GRPO2025.10 | 24.58 | — | 52.41 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-7B, Training Method=GVM-GRPO2025.10 | 23.54 | — | 50.64 | |
| +CurES-RPPBase Model=Qwen2.5-Math-7B, Training Method=CurES-RPP2025.10 | 23.33 | — | 49.62 | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-GRPO2025.10 | 20.21 | — | 48.84 | |
| +GRPOBase Model=Qwen2.5-Math-7B, Training Method=GRPO2025.10 | 20 | — | 47.59 | |
| +RPPBase Model=Qwen2.5-Math-7B, Training Method=RPP2025.10 | 18.54 | — | 50.18 | |
| +GVM-RPPBase Model=Qwen2.5-Math-7B, Training Method=GVM-RPP2025.10 | 17.5 | — | 46.95 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-RPP2025.10 | 17.29 | — | 49.56 | |
| +CurES-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-GRPO2025.10 | 13.33 | — | 44.94 | |
| +CurES-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-RPP2025.10 | 12.71 | — | 44.14 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-RPP2025.10 | 12.58 | — | 41.75 | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-GRPO2025.10 | 12.08 | — | 41.34 | |
| +GVM-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-RPP2025.10 | 11.46 | — | 42.21 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-GRPO2025.10 | 10.21 | — | 42.82 | |
| +GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GRPO2025.10 | 8.54 | — | 41.64 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Method=Base2025.10 | 7.92 | — | 33.48 | |
| +RPPBase Model=Qwen2.5-Math-1.5B, Training Method=RPP2025.10 | 4.17 | — | 35.86 | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B, Training Method=Base2025.10 | 1.67 | — | 20 |