Mathematical Problem Solving on MATH (Pass@1, Pass@16)
90.8Pass@1MIXED-CUTS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MIXED-CUTSModel Scale=Qwen3-4B, Thinking Mode=Non-thinking2026.04 | 90.8 | 96.6 | |
| Base ModelModel Scale=Qwen3-4B, Thinking Mode=Thinking2026.04 | 89.9 | 95.7 | |
| GRPOModel Scale=Qwen3-4B, Thinking Mode=Non-thinking2026.04 | 86.4 | 95.9 | |
| MIXED-CUTSModel Scale=Qwen3-1.7B, Thinking Mode=Non-thinking2026.04 | 85.1 | 95.3 | |
| GRPOModel Scale=Qwen3-1.7B, Thinking Mode=Non-thinking2026.04 | 83.6 | 93.9 | |
| Base ModelModel Scale=Qwen3-1.7B, Thinking Mode=Thinking2026.04 | 82.6 | 93.2 | |
| Base ModelModel Scale=Qwen3-4B, Thinking Mode=Non-thinking2026.04 | 82.5 | 94.4 | |
| VHG (Soft)2026.05 | 78.99 | — | |
| Vanilla-GRPO2026.05 | 76.76 | — | |
| Vanilla-GRPOtraining_variant=w. SFT data2026.05 | 76.28 | — | |
| R-ZeroIteration=22026.05 | 73.59 | — | |
| R-ZeroIteration=12026.05 | 73.51 | — | |
| R-ZeroIteration=32026.05 | 72.91 | — | |
| WizardMathBackbone=Mathstral-7B-v0.1, Decoding strategy=Greedy, Evaluation protocol=fine-tuning2026.05 | 70.9 | — | |
| Base ModelModel Scale=Qwen3-1.7B, Thinking Mode=Non-thinking2026.04 | 70.2 | 90.5 | |
| Qwen3-4B-Base2026.05 | 66.92 | — |