Mathematical Reasoning on MINERVA (Pass@1, Avg.)
41.54Pass@1LoRA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LoRAModel=7B2026.06 | 41.54 | — | |
| LoRA-αModel=7B2026.06 | 41.54 | — | |
| Base modelModel=7B2026.06 | 40.8 | — | |
| Full Fine-TuningModel=7B2026.06 | 40.8 | — | |
| LoRA (10× LR)Model=7B2026.06 | 40.07 | — | |
| +RPPBase Model=Qwen2.5-Math-7B, Training Method=RPP2025.10 | 39.71 | 50.18 | |
| +CurES-GRPOBase Model=Qwen2.5-Math-7B, Training Method=CurES-GRPO2025.10 | 37.87 | 52.41 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-RPP2025.10 | 37.13 | 49.56 | |
| +CurES-RPPBase Model=Qwen2.5-Math-7B, Training Method=CurES-RPP2025.10 | 33.09 | 49.62 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-7B, Training Method=GVM-GRPO2025.10 | 32.72 | 50.64 | |
| +GRPOBase Model=Qwen2.5-Math-7B, Training Method=GRPO2025.10 | 31.99 | 47.59 | |
| +CurES-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-GRPO2025.10 | 31.62 | 44.94 | |
| Qwen2.5-Math-1.5B + MoPPSBackbone=Qwen2.5-Math-1.5B, Training Method=MoPPS2025.10 | 31.62 | — | |
| Qwen2.5-Math-1.5B + CurES-GRPOBackbone=Qwen2.5-Math-1.5B, Training Method=CurES-GRPO2025.10 | 31.62 | — | |
| Full Fine-TuningModel=1.5B2026.06 | 31.25 | — | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-GRPO2025.10 | 29.41 | 48.84 | |
| LoRA-αModel=1.5B2026.06 | 29.41 | — | |
| GRPO + PIPOModel=Qwen3-8B-Base2026.04 | 29.4 | — | |
| +GVM-RPPBase Model=Qwen2.5-Math-7B, Training Method=GVM-RPP2025.10 | 29.04 | 46.95 | |
| LoRA (10× LR)Model=1.5B2026.06 | 29.04 | — | |
| DAPO + PIPOModel=Qwen3-8B-Base2026.04 | 29 | — | |
| +CurES-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-RPP2025.10 | 28.31 | 44.14 | |
| GRPOModel=Qwen3-8B-Base2026.04 | 28.3 | — | |
| DAPOModel=Qwen3-8B-Base2026.04 | 28.3 | — | |
| +GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GRPO2025.10 | 27.94 | 41.64 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-RPP2025.10 | 27.94 | 41.75 | |
| Qwen2.5-Math-1.5B + DAPOBackbone=Qwen2.5-Math-1.5B, Training Method=DAPO2025.10 | 27.94 | — | |
| GRPO + PIPOModel=Qwen3-4B-Base2026.04 | 27.9 | — | |
| DAPO + PIPOModel=Qwen3-4B-Base2026.04 | 27.9 | — | |
| GSPOModel=Qwen3-8B-Base2026.04 | 27.6 | — | |
| LoRAModel=1.5B2026.06 | 27.57 | — | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-GRPO2025.10 | 27.4 | 41.34 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-GRPO2025.10 | 27.21 | 42.82 | |
| GSPOModel=Qwen3-4B-Base2026.04 | 27.2 | — | |
| DAPOModel=Qwen3-4B-Base2026.04 | 27 | — | |
| GSPO + PIPOModel=Qwen3-8B-Base2026.04 | 26.4 | — | |
| GRPOModel=Qwen3-4B-Base2026.04 | 25.4 | — | |
| +GVM-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-RPP2025.10 | 24.63 | 42.21 | |
| GSPO + PIPOModel=Qwen3-4B-Base2026.04 | 24.3 | — | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Method=Base2025.10 | 22.79 | 33.48 | |
| +RPPBase Model=Qwen2.5-Math-1.5B, Training Method=RPP2025.10 | 21.32 | 35.86 | |
| Base ModelModel=Qwen3-8B-Base2026.04 | 17.3 | — | |
| Base ModelModel=Qwen3-4B-Base2026.04 | 14 | — | |
| Base modelModel=1.5B2026.06 | 13.33 | — | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B, Training Method=Base2025.10 | 11.4 | 20 | |
| Qwen2.5-Math-1.5BBackbone=Qwen2.5-Math-1.5B, Training Method=Base2025.10 | 11.4 | — |