Math Reasoning on AIME 25 (Pass@1, Pass@16)
40.53Pass@1GSPO + NSR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GSPO + NSRModel=Qwen3-30B-A3B-Base, Setting=MoE + 20k, Zero-shot=true, k=32, Temperature=1.02026.05 | 40.53 | 64.83 | |
| GSPOModel=Qwen3-30B-A3B-Base, Setting=MoE + 20k, Zero-shot=true, k=32, Temperature=1.02026.05 | 38.44 | 56.67 | |
| DAPO + NSRModel=Qwen3-8B-Base, Setting=Dense + 30k, Zero-shot=true, k=32, Temperature=1.02026.05 | 31.67 | 55.87 | |
| EAPOModel=Qwen-3-8B-Base2026.06 | 30.92 | 52.54 | |
| MOPDModel=Qwen-3-8B-Base2026.06 | 29.38 | 52.25 | |
| OPDModel=Qwen-3-8B-Base2026.06 | 27.81 | 50.9 | |
| DAPOModel=Qwen3-8B-Base, Setting=Dense + 30k, Zero-shot=true, k=32, Temperature=1.02026.05 | 27.39 | 48.98 | |
| DAPOModel=Qwen-3-8B-Base2026.06 | 27.39 | 48.98 | |
| GRPOModel=Qwen-3-8B-Base2026.06 | 23.54 | 50.91 | |
| DAPO + NSRModel=Qwen2.5-Math-7B, Setting=Dense + 8k, Zero-shot=true, k=32, Temperature=1.02026.05 | 17.57 | 32.78 | |
| EAPOModel=Qwen-2.5-Math-7B2026.06 | 17.08 | 37.04 | |
| Trajectory ReplayModel=Qwen-2.5-Math-7B2026.06 | 16.24 | 34.12 | |
| MOPDModel=Qwen-2.5-Math-7B2026.06 | 15.93 | 33.08 | |
| EAPO w/o sISModel=Qwen-2.5-Math-7B2026.06 | 15.93 | 35.46 | |
| DAPOModel=Qwen2.5-Math-7B, Setting=Dense + 8k, Zero-shot=true, k=32, Temperature=1.02026.05 | 15.9 | 30.7 | |
| DAPOModel=Qwen-2.5-Math-7B2026.06 | 15.62 | 30.6 | |
| OPDModel=Qwen-2.5-Math-7B2026.06 | 15.21 | 29.14 | |
| GRPOModel=Qwen-2.5-Math-7B2026.06 | 11.77 | 24.56 |