Mathematical Reasoning on MATH-500 (Avg@16)
94.61Avg@16DISPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DISPOModel=Qwen3-14B-Base2026.02 | 94.61 | — | |
| CISPOModel=Qwen3-14B-Base2026.02 | 93.15 | — | |
| DISPOModel=Qwen3-30B-A3B-Base (MoE)2026.02 | 92.59 | — | |
| DISPOModel=Qwen3-8B-Base2026.02 | 92.34 | — | |
| DAPOModel=Qwen3-14B-Base2026.02 | 91.89 | — | |
| DAPOModel=Qwen3-8B-Base2026.02 | 91.25 | — | |
| CISPOModel=Qwen3-30B-A3B-Base (MoE)2026.02 | 91.18 | — | |
| OISDBackbone=Qwen3-4B2026.05 | 90.99 | 64.75 | |
| CISPOModel=Qwen3-8B-Base2026.02 | 90.74 | — | |
| DAPOModel=Qwen3-30B-A3B-Base (MoE)2026.02 | 90.56 | — | |
| OISDBackbone=Qwen3-8B2026.05 | 89.38 | 66.72 | |
| GRPOBackbone=Qwen3-8B2026.05 | 88.05 | 64.23 | |
| BuPOBackbone=Qwen3-8B2026.05 | 87.76 | 66.36 | |
| BuPOBackbone=Qwen3-4B2026.05 | 84.9 | 58.51 | |
| PPOBackbone=Qwen3-4B2026.05 | 83.64 | 55.22 | |
| RLOOBackbone=Qwen3-4B2026.05 | 82.73 | 54 | |
| GRPOBackbone=Qwen3-4B2026.05 | 82.41 | 55.08 | |
| Reinforce++Backbone=Qwen3-4B2026.05 | 80.63 | 45.03 | |
| VanillaBackbone=Qwen3-8B2026.05 | 80.46 | 48.49 | |
| VanillaBackbone=Qwen3-4B2026.05 | 80.29 | 47.44 | |
| Starting checkpointModel=Qwen3-14B-Base2026.02 | 73.91 | — | |
| Starting checkpointModel=Qwen3-30B-A3B-Base (MoE)2026.02 | 73.54 | — | |
| Starting checkpointModel=Qwen3-8B-Base2026.02 | 71.22 | — | |
| OISDBackbone=OctoThinker-8B-Long-Base2026.05 | 66.19 | 30.09 | |
| BuPOBackbone=OctoThinker-8B-Long-Base2026.05 | 62.05 | 27.79 | |
| GRPOBackbone=OctoThinker-8B-Long-Base2026.05 | 56.89 | 24.11 | |
| BuPOBackbone=OctoThinker-3B-Long-Base2026.05 | 49.79 | 19.59 | |
| OISDBackbone=OctoThinker-3B-Long-Base2026.05 | 49.41 | 19.91 | |
| GRPOBackbone=OctoThinker-3B-Long-Base2026.05 | 46.07 | 18.58 | |
| VanillaBackbone=OctoThinker-8B-Long-Base2026.05 | 9.84 | 3.75 | |
| VanillaBackbone=OctoThinker-3B-Long-Base2026.05 | 5.26 | 1.68 |