Mathematical Reasoning on AIME24 (Pass@1 Accuracy, Avg Output Length)
78.9Pass@1 AccuracyAlphaOne
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AlphaOneBackbone=Qwen3-32B-thinking2026.04 | 78.9 | 8,007 | |
| GRPOBackbone=Qwen3-32B-thinking2026.04 | 78.9 | 11,934 | |
| DAPOBackbone=Qwen3-32B-thinking2026.04 | 78.9 | 12,038 | |
| NeuReasonerBackbone=Qwen3-32B-thinking2026.04 | 78.9 | 6,029 | |
| VanillaBackbone=Qwen3-32B-thinking2026.04 | 77.8 | 10,677 | |
| DASTBackbone=Qwen3-32B-thinking2026.04 | 77.8 | 5,981 | |
| S-GRPOBackbone=Qwen3-32B-thinking2026.04 | 77.8 | 6,040 | |
| Think or NotBackbone=Qwen3-32B-thinking2026.04 | 76.7 | 6,173 | |
| RL + LPBackbone=Qwen3-32B-thinking2026.04 | 76.7 | 6,238 | |
| NeuReasonerBackbone=R1-Qwen-32B2026.04 | 74.4 | 4,456 | |
| NeuReasonerBackbone=Qwen3-8B-thinking2026.04 | 74.4 | 6,609 | |
| NeuReasonerBackbone=R1-Llama-70B2026.04 | 74.4 | 5,237 | |
| GRPOBackbone=R1-Qwen-32B2026.04 | 73.3 | 8,389 | |
| DAPOBackbone=R1-Qwen-32B2026.04 | 73.3 | 8,817 | |
| AlphaOneBackbone=Qwen3-8B-thinking2026.04 | 73.3 | 8,343 | |
| S-GRPOBackbone=Qwen3-8B-thinking2026.04 | 73.3 | 6,771 | |
| DAPOBackbone=R1-Llama-70B2026.04 | 73.3 | 8,589 | |
| AlphaOneBackbone=R1-Qwen-32B2026.04 | 72.2 | 8,210 | |
| GRPOBackbone=Qwen3-8B-thinking2026.04 | 72.2 | 10,931 | |
| AlphaOneBackbone=R1-Llama-70B2026.04 | 72.2 | 7,873 | |
| GRPOBackbone=R1-Llama-70B2026.04 | 72.2 | 8,109 | |
| RL + LPBackbone=R1-Qwen-32B2026.04 | 71.1 | 5,492 | |
| RL + LPBackbone=Qwen3-8B-thinking2026.04 | 71.1 | 6,986 | |
| DAPOBackbone=Qwen3-8B-thinking2026.04 | 71.1 | 11,781 | |
| Think or NotBackbone=R1-Llama-70B2026.04 | 71.1 | 4,005 | |
| VanillaBackbone=R1-Qwen-32B2026.04 | 70 | 7,873 | |
| DASTBackbone=R1-Qwen-32B2026.04 | 70 | 5,802 | |
| S-GRPOBackbone=R1-Qwen-32B2026.04 | 70 | 4,906 | |
| VanillaBackbone=Qwen3-8B-thinking2026.04 | 70 | 11,125 | |
| S-GRPOBackbone=R1-Llama-70B2026.04 | 70 | 5,002 | |
| Think or NotBackbone=Qwen3-8B-thinking2026.04 | 68.9 | 5,387 | |
| VanillaBackbone=R1-Llama-70B2026.04 | 68.9 | 7,766 | |
| Think or NotBackbone=R1-Qwen-32B2026.04 | 67.8 | 3,993 | |
| DASTBackbone=Qwen3-8B-thinking2026.04 | 67.8 | 5,964 | |
| DASTBackbone=R1-Llama-70B2026.04 | 67.8 | 5,115 | |
| RL + LPBackbone=R1-Llama-70B2026.04 | 66.7 | 5,304 | |
| ExpThinkBackbone=Qwen3-8B2026.05 | 65.6 | 4,581.3 | |
| VanillaBackbone=Qwen3-8B2026.05 | 61.7 | 11,903.7 | |
| DAPOBackbone=R1-Qwen-7B2026.04 | 57.8 | 11,908 | |
| NeuReasonerBackbone=R1-Qwen-7B2026.04 | 57.8 | 4,997 | |
| GRPOBackbone=R1-Qwen-7B2026.04 | 56.7 | 11,673 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 56 | 6,063.4 | |
| DASTBackbone=R1-Qwen-7B2026.04 | 55.6 | 7,258 | |
| AlphaOneBackbone=R1-Qwen-7B2026.04 | 55.6 | 8,224 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 54.8 | 8,693.6 | |
| VanillaBackbone=R1-Qwen-7B2026.04 | 54.4 | 10,438 | |
| S-GRPOBackbone=R1-Qwen-7B2026.04 | 54.4 | 5,094 | |
| ExpThinkBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 54.4 | 5,196.2 | |
| VanillaBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 54 | 10,063.7 | |
| AdaptThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 53.8 | 8,738.8 | |
| AutoThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 53.3 | 6,909.5 | |
| JETBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 52.9 | 7,863.6 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 52.8 | 8,247.3 | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 52.3 | 9,310.9 | |
| Think or NotBackbone=R1-Qwen-7B2026.04 | 52.2 | 4,341 | |
| RL + LPBackbone=R1-Qwen-7B2026.04 | 52.2 | 5,693 | |
| VanillaBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 51.7 | 10,688.6 | |
| LaserBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 51.7 | 4,860.9 | |
| NeuReasonerBackbone=R1-Llama-8B2026.04 | 50 | 5,116 | |
| TRiMSBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 49.6 | 1,531.2 | |
| AlphaOneBackbone=R1-Llama-8B2026.04 | 47.8 | 8,339 | |
| LC-R1Backbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 47.7 | 7,002.4 | |
| DAPOBackbone=R1-Llama-8B2026.04 | 46.7 | 12,079 | |
| LC-R1Base Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 46 | 5,859.9 | |
| VanillaBackbone=R1-Llama-8B2026.04 | 45.6 | 10,798.9 | |
| DASTBackbone=R1-Llama-8B2026.04 | 45.6 | 8,246 | |
| RL + LPBackbone=R1-Llama-8B2026.04 | 45.6 | 5,333 | |
| S-GRPOBackbone=R1-Llama-8B2026.04 | 45.6 | 4,809 | |
| Think or NotBackbone=R1-Llama-8B2026.04 | 44.4 | 6,761 | |
| GRPOBackbone=R1-Llama-8B2026.04 | 44.4 | 11,312 | |
| MURBackbone=Qwen3-8B, Search Strategy=phi-Decoding2025.07 | 36.67 | 20,969 | |
| LaserBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 30.4 | 5,713.1 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 30.4 | 6,704.7 | |
| AutoThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 30 | 8,984.4 | |
| DPO-LoRRFine-tuning base=Qwen2.5-Math-7B, Iteration=iter22025.08 | 30 | — | |
| DPO-LoRRFine-tuning base=Qwen2.5-Math-7B, Iteration=iter32025.08 | 30 | — | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 30 | 9,730.5 | |
| TRiMSBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 29.8 | 2,196.5 | |
| AdaptThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 29.6 | 7,268 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 29.6 | 8,044.2 | |
| MURBackbone=Qwen3-4B, Search Strategy=Guided search2025.07 | 29.58 | 4,265 | |
| JETBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 29.4 | 6,121.9 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 29.4 | 8,108.2 | |
| VanillaBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 29.2 | 12,303.4 | |
| ExpThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 28.8 | 5,350.4 | |
| VanillaBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 27.9 | 12,019.2 | |
| rStarFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Non-comparable Baselines2025.08 | 26.7 | — | |
| DPO-VPFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Comparable Baselines (zero setting or less expert data)2025.08 | 26.7 | — | |
| LC-R1Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 25.2 | 7,359.4 | |
| DeepSeek-R1-Distill-Qwen-1.5BModel Scale=1.5B2026.04 | 23.3 | 8,432.9 | |
| Qwen2.5Fine-tuning base=Qwen2.5-Math-7B, Comparison Group=Base2025.08 | 23.3 | — | |
| PRIMEFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Non-comparable Baselines2025.08 | 23.3 | — | |
| PURE-VRFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Comparable Baselines (zero setting or less expert data)2025.08 | 23.3 | — | |
| DPO-R1Fine-tuning base=Qwen2.5-Math-7B, Comparison Group=Comparable Baselines (zero setting or less expert data)2025.08 | 23.3 | — | |
| DPO-LoRRFine-tuning base=Qwen2.5-Math-7B, Iteration=iter12025.08 | 23.3 | — | |
| Evo-L2S (Accuracy)Model Scale=1.5B, Merging Strategy=Single-Objective Evolutionary Merging, Optimization Objective=Accuracy2026.04 | 20 | 4,904.9 | |
| S1Fine-tuning base=Qwen2.5-Math-7B, Comparison Group=Comparable Baselines (zero setting or less expert data)2025.08 | 20 | — | |
| Simple-RLFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Comparable Baselines (zero setting or less expert data)2025.08 | 20 | — | |
| MURBackbone=Qwen3-1.7B, Search Strategy=LLM as a critic2025.07 | 19.38 | 3,892 | |
| LC-R1Base Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 19.3 | 6,737.5 |