Mathematical Reasoning on AIME24
97.3AccuracyHyPER
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| HyPERModel=Qwen3-Next2026.02 | 97.3 | — | 0.61 | — | — | |
| R1-SearcherCategory=RL-only TIR Methods2026.01 | 95 | — | — | — | — | |
| DeepConfModel=Qwen3-Next2026.02 | 94.7 | — | 0.47 | — | — | |
| HyPERModel=Qwen3-30B2026.02 | 94 | — | 0.54 | — | — | |
| Qwen2.5-7B-InstructFramework=Multi-Dimensional Trajectory Evaluation2026.01 | 93 | — | — | — | — | |
| AutoTrajCategory=SFT-RL TIR Methods2026.01 | 93 | — | — | — | — | |
| DeepConfModel=Qwen3-30B2026.02 | 92.7 | — | 0.46 | — | — | |
| DeepConfModel=DeepSeek-8B, Compute Budget=@5122026.02 | 92 | 14.5 | — | — | — | |
| RoEModel=Qwen3-Next2026.02 | 92 | — | 1.59 | — | — | |
| CoRefine TreeModel=Qwen3-32B, Compute Budget=@5122026.02 | 90.7 | 0.14 | — | — | — | |
| SCModel=Qwen3-Next2026.02 | 90.7 | — | 1 | — | — | |
| CoRefine TreeModel=DeepSeek-8B, Compute Budget=@5122026.02 | 90.6 | 0.49 | — | — | — | |
| CoRefineModel=DeepSeek-8B, Compute Budget=@5122026.02 | 90 | 0.38 | — | — | — | |
| DeepConfModel=Qwen3-32B, Compute Budget=@5122026.02 | 89.3 | 8.8 | — | — | — | |
| CoRefineModel=Qwen3-32B, Compute Budget=@5122026.02 | 89.3 | 0.07 | — | — | — | |
| RoEModel=Qwen3-30B2026.02 | 88.7 | — | 1.38 | — | — | |
| SCModel=Qwen3-30B2026.02 | 88 | — | 1 | — | — | |
| Self-CertaintyModel=Qwen3-Next2026.02 | 87.7 | — | 1.06 | — | — | |
| Tool-StarCategory=SFT-RL TIR Methods2026.01 | 87 | — | — | — | — | |
| MaASMAS-Arch=Adaptive, ProVe Level=Iteration, Verifier Type=RM2026.02 | 86.11 | — | — | — | — | |
| DyLANMAS-Arch=Adaptive, ProVe Level=Agent, Verifier Type=Judge2026.02 | 85.56 | — | — | — | — | |
| MajorityModel=Qwen3-32B, Compute Budget=@5122026.02 | 85.4 | 20 | — | — | — | |
| MajorityModel=DeepSeek-8B, Compute Budget=@5122026.02 | 85.3 | 35.5 | — | — | — | |
| DyLANMAS-Arch=Adaptive, ProVe Level=Iteration, Verifier Type=Judge2026.02 | 84.44 | — | — | — | — | |
| MaASMAS-Arch=Adaptive, ProVe Level=Agent, Verifier Type=RM2026.02 | 84.03 | — | — | — | — | |
| LUSPOBase model=Qwen3-30B-A3B-Instruct2026.02 | 83.6 | — | — | — | — | |
| MaASMAS-Arch=Adaptive, ProVe Level=Agent, Verifier Type=PRM2026.02 | 83.33 | — | — | — | — | |
| Self-CertaintyModel=Qwen3-30B2026.02 | 83.3 | — | 0.94 | — | — | |
| DyLANMAS-Arch=Adaptive, ProVe Level=Iteration, Verifier Type=PRM2026.02 | 82.22 | — | — | — | — | |
| MaASMAS-Arch=Adaptive, ProVe Level=Iteration, Verifier Type=PRM2026.02 | 81.94 | — | — | — | — | |
| DebateMAS-Arch=Fixed, ProVe Level=Agent, Verifier Type=Judge2026.02 | 81.11 | — | — | — | — | |
| DebateMAS-Arch=Fixed, ProVe Level=Iteration, Verifier Type=RM2026.02 | 81.11 | — | — | — | — | |
| DyLANMAS-Arch=Adaptive, ProVe Level=No ProVe, Verifier Type=None2026.02 | 81.11 | — | — | — | — | |
| MaASMAS-Arch=Adaptive, ProVe Level=Agent, Verifier Type=Judge2026.02 | 80.55 | — | — | — | — | |
| Tool-Star-SFTCategory=SFT-only TIR Methods2026.01 | 80 | — | — | — | — | |
| AutoTIRCategory=RL-only TIR Methods2026.01 | 80 | — | — | — | — | |
| DyLANMAS-Arch=Adaptive, ProVe Level=Iteration, Verifier Type=RM2026.02 | 78.89 | — | — | — | — | |
| Vanilla SFT-RL TIRCategory=SFT-RL TIR Methods2026.01 | 78 | — | — | — | — | |
| DyLANMAS-Arch=Adaptive, ProVe Level=Agent, Verifier Type=PRM2026.02 | 77.78 | — | — | — | — | |
| MaASMAS-Arch=Adaptive, ProVe Level=Iteration, Verifier Type=Judge2026.02 | 77.22 | — | — | — | — | |
| GSPOBase model=Qwen3-30B-A3B-Instruct2026.02 | 76.7 | — | — | — | — | |
| DyLANMAS-Arch=Adaptive, ProVe Level=Agent, Verifier Type=RM2026.02 | 76.67 | — | — | — | — | |
| AFlowMAS-Arch=Fixed, ProVe Level=Agent, Verifier Type=Judge2026.02 | 76.39 | — | — | — | — | |
| MaASMAS-Arch=Adaptive, ProVe Level=No ProVe, Verifier Type=None2026.02 | 76.39 | — | — | — | — | |
| AFlowMAS-Arch=Fixed, ProVe Level=Agent, Verifier Type=RM2026.02 | 76.22 | — | — | — | — | |
| AFlowMAS-Arch=Fixed, ProVe Level=Agent, Verifier Type=PRM2026.02 | 74.17 | — | — | — | — | |
| DebateMAS-Arch=Fixed, ProVe Level=No ProVe, Verifier Type=None2026.02 | 74.13 | — | — | — | — | |
| ToRLCategory=RL-only TIR Methods2026.01 | 74 | — | — | — | — | |
| ADASMAS-Arch=Fixed, ProVe Level=Agent, Verifier Type=RM2026.02 | 73.93 | — | — | — | — | |
| ADASMAS-Arch=Fixed, ProVe Level=Agent, Verifier Type=Judge2026.02 | 73.33 | — | — | — | — | |
| DebateMAS-Arch=Fixed, ProVe Level=Iteration, Verifier Type=Judge2026.02 | 72.67 | — | — | — | — | |
| DebateMAS-Arch=Fixed, ProVe Level=Agent, Verifier Type=RM2026.02 | 71.67 | — | — | — | — | |
| ADASMAS-Arch=Fixed, ProVe Level=Iteration, Verifier Type=Judge2026.02 | 70.83 | — | — | — | — | |
| DebateMAS-Arch=Fixed, ProVe Level=Iteration, Verifier Type=PRM2026.02 | 70.34 | — | — | — | — | |
| AFlowMAS-Arch=Fixed, ProVe Level=Iteration, Verifier Type=Judge2026.02 | 69.44 | — | — | — | — | |
| DebateMAS-Arch=Fixed, ProVe Level=Agent, Verifier Type=PRM2026.02 | 68.1 | — | — | — | — | |
| ADASMAS-Arch=Fixed, ProVe Level=Agent, Verifier Type=PRM2026.02 | 68.07 | — | — | — | — | |
| ADASMAS-Arch=Fixed, ProVe Level=Iteration, Verifier Type=RM2026.02 | 66.67 | — | — | — | — | |
| AFlowMAS-Arch=Fixed, ProVe Level=No ProVe, Verifier Type=None2026.02 | 65.67 | — | — | — | — | |
| ADASMAS-Arch=Fixed, ProVe Level=Iteration, Verifier Type=PRM2026.02 | 63.87 | — | — | — | — | |
| ADASMAS-Arch=Fixed, ProVe Level=No ProVe, Verifier Type=None2026.02 | 62.49 | — | — | — | — | |
| AFlowMAS-Arch=Fixed, ProVe Level=Iteration, Verifier Type=PRM2026.02 | 61.11 | — | — | — | — | |
| w/o RLVRBase model=Qwen3-30B-A3B-Instruct2026.02 | 60 | — | — | — | — | |
| DVPOTraining Domain=Math Domain2025.12 | 56.67 | — | — | — | — | |
| AFlowMAS-Arch=Fixed, ProVe Level=Iteration, Verifier Type=RM2026.02 | 52.73 | — | — | — | — | |
| MAS-ZeroMAS-Arch=Adaptive, ProVe Level=Iteration, Verifier Type=Judge2026.02 | 50 | — | — | — | — | |
| MAS-ZeroMAS-Arch=Adaptive, ProVe Level=Agent, Verifier Type=Judge2026.02 | 47.78 | — | — | — | — | |
| MAS-ZeroMAS-Arch=Adaptive, ProVe Level=Iteration, Verifier Type=RM2026.02 | 45 | — | — | — | — | |
| Reinforce++Training Domain=Math Domain2025.12 | 45 | — | — | — | — | |
| Dr.GRPOTraining Domain=Math Domain2025.12 | 45 | — | — | — | — | |
| P-ALIGNBackbone=Qwen3-14B2026.01 | 43.33 | — | — | — | — | |
| Mixed Attention ModuleSeries=Qwen2.5-7B, beta=0.4, alpha=0.32026.02 | 43.3 | 12,730 | — | 432 | — | |
| BaseTraining Domain=Math Domain2025.12 | 41.67 | — | — | — | — | |
| CODABackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 40.8 | — | — | — | 8,394 | |
| Qwen2.5-7B (Base)Series=Qwen2.5-7B, beta=0.4, alpha=0.32026.02 | 40 | 12,901 | — | 522.1 | — | |
| GRPOBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 40 | — | — | — | 8,421 | |
| MAS-ZeroMAS-Arch=Adaptive, ProVe Level=Agent, Verifier Type=RM2026.02 | 38.89 | — | — | — | — | |
| BAPORollouts=733k, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 38.54 | — | — | — | — | |
| MAS-ZeroMAS-Arch=Adaptive, ProVe Level=No ProVe, Verifier Type=None2026.02 | 37.78 | — | — | — | — | |
| MAS-ZeroMAS-Arch=Adaptive, ProVe Level=Iteration, Verifier Type=PRM2026.02 | 37.78 | — | — | — | — | |
| VLPBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 37.1 | — | — | — | 7,780 | |
| SFTBackbone=Qwen3-14B2026.01 | 36.67 | — | — | — | — | |
| UPFTBackbone=Qwen3-14B2026.01 | 36.67 | — | — | — | — | |
| PPOTraining Domain=Math Domain2025.12 | 36.67 | — | — | — | — | |
| Robust BellmanTraining Domain=Math Domain2025.12 | 36.67 | — | — | — | — | |
| DAPORollouts=1921k, Type=on, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 35.73 | — | — | — | — | |
| GRPOTraining Domain=Math Domain2025.12 | 35 | — | — | — | — | |
| ASRRBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 35 | — | — | — | 7,714 | |
| MAS-ZeroMAS-Arch=Adaptive, ProVe Level=Agent, Verifier Type=PRM2026.02 | 33.34 | — | — | — | — | |
| Zero-ShotBackbone=Qwen3-14B2026.01 | 33.33 | — | — | — | — | |
| MoPPSRollouts=737k, Type=on, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 33.33 | — | — | — | — | |
| Remix-GRPORollouts=N/A, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 33.33 | — | — | — | — | |
| Ouro2.6B-Thinking + RLTT2026.02 | 33.3 | — | — | — | — | |
| Failure-Prefix ConditioningBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training=GRPO on Failure-Prefix Conditioned Data (tau=0.5)2026.01 | 33 | — | — | — | — | |
| MediumBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training=GRPO on Medium Difficulty Questions (tau=0.5)2026.01 | 32 | — | — | — | — | |
| GRPORollouts=677k, Type=on, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 30.73 | — | — | — | — | |
| GRPO (v = 5)Rollouts=677k, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 30.49 | — | — | — | — | |
| RePORollouts=677k, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 30.42 | — | — | — | — | |
| SaturateBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training=GRPO on Saturated Questions (No Prefix)2026.01 | 30 | — | — | — | — | |
| Qwen2.5-7B + ARPOBase Model=Qwen2.5-7B, Algorithm=ARPO2025.12 | 30 | — | — | — | — |