Mathematical Reasoning on OLYM (Pass@1, Avg.)
43.56Pass@1+CurES-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| +CurES-GRPOBase Model=Qwen2.5-Math-7B, Training Method=CurES-GRPO2025.10 | 43.56 | 52.41 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-RPP2025.10 | 42.96 | 49.56 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-7B, Training Method=GVM-GRPO2025.10 | 42.67 | 50.64 | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-GRPO2025.10 | 42.37 | 48.84 | |
| +CurES-RPPBase Model=Qwen2.5-Math-7B, Training Method=CurES-RPP2025.10 | 40.59 | 49.62 | |
| +GVM-RPPBase Model=Qwen2.5-Math-7B, Training Method=GVM-RPP2025.10 | 40.3 | 46.95 | |
| +RPPBase Model=Qwen2.5-Math-7B, Training Method=RPP2025.10 | 40 | 50.18 | |
| +GRPOBase Model=Qwen2.5-Math-7B, Training Method=GRPO2025.10 | 38.37 | 47.59 | |
| +CurES-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-GRPO2025.10 | 37.33 | 44.94 | |
| Qwen2.5-Math-1.5B + MoPPSBackbone=Qwen2.5-Math-1.5B, Training Method=MoPPS2025.10 | 37.33 | — | |
| Qwen2.5-Math-1.5B + CurES-GRPOBackbone=Qwen2.5-Math-1.5B, Training Method=CurES-GRPO2025.10 | 37.33 | — | |
| +CurES-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-RPP2025.10 | 37.04 | 44.14 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-RPP2025.10 | 36.3 | 41.75 | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-GRPO2025.10 | 35.56 | 41.34 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-GRPO2025.10 | 35.56 | 42.82 | |
| +GVM-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-RPP2025.10 | 35.56 | 42.21 | |
| +GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GRPO2025.10 | 35.41 | 41.64 | |
| Qwen2.5-Math-1.5B + DAPOBackbone=Qwen2.5-Math-1.5B, Training Method=DAPO2025.10 | 35.26 | — | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Method=Base2025.10 | 30.81 | 33.48 | |
| +RPPBase Model=Qwen2.5-Math-1.5B, Training Method=RPP2025.10 | 29.19 | 35.86 | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B, Training Method=Base2025.10 | 21.04 | 20 | |
| Qwen2.5-Math-1.5BBackbone=Qwen2.5-Math-1.5B, Training Method=Base2025.10 | 21.04 | — |