Mathematical Reasoning on MATH 500 (Pass@1, Pass@16, Mean@16)
98.4AccuracySwiR
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| SwiRBackbone=Qwen3-32B2025.10 | 98.4 | — | — | — | — | — | |
| SwiRBackbone=Qwen3-8B2025.10 | 98.4 | — | — | — | — | — | |
| CoTBackbone=Qwen3-32B2025.10 | 97.4 | — | — | — | — | — | |
| Soft ThinkingBackbone=Qwen3-32B2025.10 | 97.4 | — | — | — | — | — | |
| CoT (Greedy)Backbone=Qwen3-32B2025.10 | 97.2 | — | — | — | — | — | |
| CoT (Greedy)Backbone=Qwen3-8B2025.10 | 96.4 | — | — | — | — | — | |
| CoTBackbone=Qwen3-8B2025.10 | 96 | — | — | — | — | — | |
| Soft ThinkingBackbone=Qwen3-8B2025.10 | 96 | — | — | — | — | — | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 94.8 | — | — | — | — | — | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 93.8 | — | — | — | — | — | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 93.8 | — | — | — | — | — | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 93.2 | — | — | — | — | — | |
| SwiRBackbone=Qwen3-1.7B2025.10 | 93 | — | — | — | — | — | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 93 | — | — | — | — | — | |
| LaPha / sg@128Base model=Qwen2.5-Math-7B, Tool=✓2026.02 | 92 | — | — | — | — | — | |
| CoTBackbone=Qwen3-1.7B2025.10 | 92 | — | — | — | — | — | |
| SwiRBackbone=DeepSeek-R1-Distill-Llama-8B2025.10 | 92 | — | — | — | — | — | |
| CoTBackbone=DeepSeek-R1-Distill-Llama-8B2025.10 | 91.4 | — | — | — | — | — | |
| CoT (Greedy)Backbone=Qwen3-1.7B2025.10 | 91 | — | — | — | — | — | |
| 4BModel=4B, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 91 | — | — | — | — | — | |
| Soft ThinkingBackbone=Qwen3-1.7B2025.10 | 90.6 | — | — | — | — | — | |
| GPT-o1-miniTool=✗2026.02 | 90 | — | — | — | — | — | |
| HeRLModel=Qwen3-4B-Instruct-2507, Training Method=HeRL2026.03 | 89.8 | — | — | — | — | — | |
| BAPORollouts=733k, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 89.18 | — | — | — | — | — | |
| LaPha / sg@128Base model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 88.2 | — | — | — | — | — | |
| 4BModel=4B, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 88 | — | — | — | — | — | |
| 4BModel=4B, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 87.6 | — | — | — | — | — | |
| TTSRBackbone Model=Qwen3-8B-Base2026.02 | 87.5 | — | — | — | — | — | |
| GRPO (v = 5)Rollouts=677k, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 86.72 | — | — | — | — | — | |
| DAPORollouts=1921k, Type=on, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 86.05 | — | — | — | — | — | |
| LaPha / sg@128Base model=Qwen2.5-7B, Tool=✓2026.02 | 86 | — | — | — | — | — | |
| Qwen3-4B-Instruct-2507Model=Qwen3-4B-Instruct-2507, Training Method=Instruct2026.03 | 86 | — | — | — | — | — | |
| GRPORollouts=677k, Type=on, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 85.4 | — | — | — | — | — | |
| 4BModel=4B, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 85.4 | — | — | — | — | — | |
| MoPPSRollouts=737k, Type=on, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 84.94 | — | — | — | — | — | |
| CoT (Greedy)Backbone=DeepSeek-R1-Distill-Llama-8B2025.10 | 84.8 | — | — | — | — | — | |
| Remix-GRPORollouts=N/A, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 84.6 | — | — | — | — | — | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 84.4 | — | — | — | — | — | |
| TTRLBackbone Model=Qwen3-8B-Base2026.02 | 84.3 | — | — | — | — | — | |
| Soft ThinkingBackbone=DeepSeek-R1-Distill-Llama-8B2025.10 | 83.8 | — | — | — | — | — | |
| RePORollouts=677k, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 83.75 | — | — | — | — | — | |
| DAPOBase model=Qwen2.5-Math-7B, Tool=✗2026.02 | 83 | — | — | — | — | — | |
| DeepSeek R1 Distill Qwen 1.5BRollouts=N/A, Type=N/A2026.02 | 82.8 | — | — | — | — | — | |
| WISTBackbone=Qwen3-8B-Base2026.03 | 82.6 | — | — | — | — | — | |
| TTSRBackbone Model=Qwen3-4B-Base2026.02 | 82.4 | — | — | — | — | — | |
| ToRLBase model=Qwen2.5-Math-7B, Tool=✓2026.02 | 82.2 | — | — | — | — | — | |
| R-ZeroBackbone Model=Qwen3-8B-Base2026.02 | 82.1 | — | — | — | — | — | |
| SPICEBackbone=Qwen3-8B-Base2026.03 | 81.8 | — | — | — | — | — | |
| 4B-BaseModel=4B-Base, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 80.8 | — | — | — | — | — | |
| ∇-ReasonerBackbone=Qwen-2.5-7B-Instruct, Nmax=82026.03 | 80.4 | — | — | — | — | — | |
| R-ZeroBackbone=Qwen3-8B-Base2026.03 | 80.4 | — | — | — | — | — | |
| 4BModel=4B, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 80.2 | — | — | — | — | — | |
| RAPBackbone=Qwen-2.5-7B-Instruct2026.03 | 80.2 | — | — | — | — | — | |
| Surrogate-TraceStudent Model=Qwen, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 79.8 | — | — | — | — | — | |
| LaPhaBase model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 79.6 | — | — | — | — | — | |
| 4B-BaseModel=4B-Base, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 79.6 | — | — | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 79.6 | — | — | — | — | — | |
| CCPOModel=qwen3-4b-base, Agent Configuration=Dual-Agent2026.03 | 79.4 | — | — | — | — | — | |
| PrimeBase model=Qwen2.5-Math-7B, Tool=✗2026.02 | 79.2 | — | — | — | — | — | |
| TTRLBackbone Model=Qwen3-4B-Base2026.02 | 79.1 | — | — | — | — | — | |
| SFTBase model=Qwen2.5-Math-7B, Tool=✓2026.02 | 78.8 | — | — | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 78.6 | — | — | — | — | — | |
| 4B-BaseModel=4B-Base, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 78.2 | — | — | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 78.2 | — | — | — | — | — | |
| WISTBackbone=Qwen3-4B-Base2026.03 | 78.2 | — | — | — | — | — | |
| ReMAModel=qwen3-4b-base, Agent Configuration=Dual-Agent2026.03 | 78 | — | — | — | — | — | |
| Base ModelBackbone Model=Qwen3-8B-Base2026.02 | 77.9 | — | — | — | — | — | |
| DPPOModel=Qwen3-4B, Speedup=2.37×, rq=0.9, ro=0.92026.03 | 77.9 | — | — | — | — | — | |
| ToRLBase model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 77.8 | — | — | — | — | — | |
| BoNBackbone=Qwen-2.5-7B-Instruct, N=82026.03 | 77.8 | — | — | — | — | — | |
| TPOBackbone=Qwen-2.5-7B-Instruct2026.03 | 77.6 | — | — | — | — | — | |
| Synthesized-TraceStudent Model=Qwen, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 77.6 | — | — | — | — | — | |
| Synthesized-TraceSurrogate=R1, Student Model=Qwen2026.03 | 77.6 | — | — | — | — | — | |
| HeRLModel=Qwen2.5-7B-Instruct, Training Method=HeRL2026.03 | 77.6 | — | — | — | — | — | |
| CCPOModel=qwen2.5-7b-instruct, Agent Configuration=Dual-Agent2026.03 | 77.6 | — | — | — | — | — | |
| baseline-GroupAModel=Qwen2.5 (7B-Instruct)2026.03 | 77.6 | — | — | — | — | — | |
| ARE-GroupAModel=Qwen2.5 (7B-Instruct)2026.03 | 77.6 | — | — | — | — | — | |
| DAPOBase model=Qwen2.5-7B, Tool=✗2026.02 | 77.4 | — | — | — | — | — | |
| baseline-GroupBModel=Qwen2.5 (7B-Instruct)2026.03 | 77.4 | — | — | — | — | — | |
| ARE-GroupBModel=Qwen2.5 (7B-Instruct)2026.03 | 77.4 | — | — | — | — | — | |
| SimpleRLBase model=Qwen2.5-Math-7B, Tool=✗2026.02 | 77.2 | — | — | — | — | — | |
| XTFBackbone=Deepseek-distilled-qwen, Parameters=14B, LoRA=true2026.02 | 77.2 | — | — | — | — | — | |
| DPPOModel=Qwen3-8B, Speedup=1.90×, rq=0.9, ro=0.92026.03 | 77.1 | — | — | — | — | — | |
| R-ZeroBackbone=Qwen3-4B-Base2026.03 | 77 | — | — | — | — | — | |
| R-ZeroBackbone Model=Qwen3-4B-Base2026.02 | 76.8 | — | — | — | — | — | |
| GRESOModel=Qwen3-8B, Speedup=1.88×2026.03 | 76.65 | — | — | — | — | — | |
| GPT-4oTool=✗2026.02 | 76.6 | — | — | — | — | — | |
| SCBackbone=Qwen-2.5-7B-Instruct, N=82026.03 | 76.6 | — | — | — | — | — | |
| GRESOModel=Qwen3-4B, Speedup=2.31×2026.03 | 76.4 | — | — | — | — | — | |
| GRPOModel=Qwen3-4B, Speedup=1.00×2026.03 | 76.2 | — | — | — | — | — | |
| SPICEBackbone=Qwen3-4B-Base2026.03 | 76.2 | — | — | — | — | — | |
| DAPOBase model=Qwen2.5-Math-1.5B, Tool=✗2026.02 | 76 | — | — | — | — | — | |
| Qwen2.5-7B-InstructModel=Qwen2.5-7B-Instruct, Training Method=Instruct2026.03 | 76 | — | — | — | — | — | |
| GRPOModel=Qwen3-8B, Speedup=1.00×2026.03 | 75.8 | — | — | — | — | — | |
| 4B-BaseModel=4B-Base, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 75.6 | — | — | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 75.6 | — | — | — | — | — | |
| CPPOModel=Qwen3-8B, Speedup=1.32×2026.03 | 75.4 | — | — | — | — | — | |
| ToTBackbone=Qwen-2.5-7B-Instruct2026.03 | 75.4 | — | — | — | — | — | |
| ReMAModel=qwen2.5-7b-instruct, Agent Configuration=Dual-Agent2026.03 | 75.4 | — | — | — | — | — | |
| SLMBackbone=Deepseek-distilled-qwen, Parameters=14B, LoRA=true2026.02 | 75.3 | — | — | — | — | — |