Mathematical Problem Solving on AMC (Pass@1, Pass@16)
78.36Pass@1OWPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OWPOModel=Qwen-3-8B-Base, Checkpoint Status=Converged2026.05 | 78.36 | 91.4 | |
| DAPOModel=Qwen-2.5-Math-7B-Base, Checkpoint Status=Converged2026.05 | 77.86 | 89.05 | |
| MIXED-CUTSModel Scale=Qwen3-4B, Thinking Mode=Non-thinking2026.04 | 76.7 | 91.9 | |
| OWPOModel=Qwen-2.5-Math-7B-Base, Checkpoint Status=Converged2026.05 | 74.02 | 87.29 | |
| DAPOModel=Qwen-3-8B-Base, Checkpoint Status=Converged2026.05 | 73.91 | 89.72 | |
| Base ModelModel Scale=Qwen3-4B, Thinking Mode=Thinking2026.04 | 73.6 | 88.3 | |
| MOPDModel=Qwen-3-8B-Base, Checkpoint Status=Converged2026.05 | 72.82 | 89.86 | |
| Sym-DAPOModel=Qwen-2.5-Math-7B-Base, Checkpoint Status=Converged2026.05 | 71.58 | 89.53 | |
| OPDModel=Qwen-3-8B-Base, Checkpoint Status=Converged2026.05 | 70.22 | 88 | |
| Sym-DAPOModel=Qwen-3-8B-Base, Checkpoint Status=Converged2026.05 | 69.95 | 88.71 | |
| OPDModel=Qwen-2.5-Math-7B-Base, Checkpoint Status=Converged2026.05 | 69.05 | 88.02 | |
| GRPOModel Scale=Qwen3-4B, Thinking Mode=Non-thinking2026.04 | 68.9 | 88.9 | |
| GRPOModel=Qwen-3-8B-Base, Checkpoint Status=Converged2026.05 | 66.98 | 89.33 | |
| GRPOModel=Qwen-2.5-Math-7B-Base, Checkpoint Status=Converged2026.05 | 64.87 | 86.67 | |
| MOPDModel=Qwen-2.5-Math-7B-Base, Checkpoint Status=Converged2026.05 | 62.91 | 84.71 | |
| MIXED-CUTSModel Scale=Qwen3-1.7B, Thinking Mode=Non-thinking2026.04 | 62.7 | 88 | |
| Base ModelModel Scale=Qwen3-4B, Thinking Mode=Non-thinking2026.04 | 61.3 | 82.9 | |
| GRPOModel Scale=Qwen3-1.7B, Thinking Mode=Non-thinking2026.04 | 59.8 | 82.9 | |
| Base ModelModel Scale=Qwen3-1.7B, Thinking Mode=Thinking2026.04 | 57.5 | 82 | |
| VHG (Soft)2026.05 | 55.31 | — | |
| Vanilla-GRPOtraining_variant=w. SFT data2026.05 | 52.97 | — | |
| Vanilla-GRPO2026.05 | 52.5 | — | |
| R-ZeroIteration=12026.05 | 52.34 | — | |
| R-ZeroIteration=32026.05 | 50.31 | — | |
| R-ZeroIteration=22026.05 | 49.84 | — | |
| Qwen3-4B-Base2026.05 | 43.28 | — | |
| Base ModelModel Scale=Qwen3-1.7B, Thinking Mode=Non-thinking2026.04 | 39.8 | 72.9 |