Mathematical Problem Solving on MATH500
93AccuracySelf-MoA
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Self-MoACategory=Other Methods2025.07 | 93 | — | — | — | — | — | |
| SMCSCategory=Ours2025.07 | 92.6 | — | — | — | — | — | |
| Symbolic-MoE*Category=Other Methods2025.07 | 90.4 | — | — | — | — | — | |
| Self Consistency (Best on Validation)Category=Other Methods2025.07 | 90.4 | — | — | — | — | — | |
| Majority VotingCategory=Other Methods2025.07 | 90.2 | — | — | — | — | — | |
| GLM-Z1-32B-0414Access=Open-source, Parameters=32B2025.07 | 90 | — | — | — | — | — | |
| Open-source Upper BoundCategory=Baselines2025.07 | 90 | — | — | — | — | — | |
| RecursiveMASRecursion Round=r=3, Setting=Scaled2026.04 | 88.2 | — | 893 | — | 2,320 | — | |
| Qwen3-32BAccess=Open-source, Parameters=32B2025.07 | 88 | — | — | — | — | — | |
| Simple RouterCategory=Other Methods2025.07 | 88 | — | — | — | — | — | |
| QwQ-32BAccess=Open-source, Parameters=32B2025.07 | 87.8 | — | — | — | — | — | |
| MoACategory=Other Methods2025.07 | 87.8 | — | — | — | — | — | |
| RecursiveMASRecursion Round=r=2, Setting=Scaled2026.04 | 87.1 | — | 953 | — | 1,974 | — | |
| SelfBudgeterModel Scale=7B2025.05 | 86.87 | — | — | — | — | 2,666.58 | |
| DeepSeek-R1-Distill-QwenModel Scale=7B2025.05 | 86.73 | — | — | — | — | 5,387.19 | |
| RecursiveMASRecursion Round=r=1, Setting=Scaled2026.04 | 86.3 | — | 816 | — | 1,701 | — | |
| Recursive-TextMASRecursion Round=r=3, Setting=Scaled2026.04 | 85.8 | — | 4,100 | — | 6,010 | — | |
| GPT-4.1Access=Close-source2025.07 | 85.8 | — | — | — | — | — | |
| TaH+Param.=4B2025.11 | 85.6 | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-32BAccess=Open-source, Parameters=32B2025.07 | 85.6 | — | — | — | — | — | |
| TaHParam.=4B2025.11 | 84.4 | — | — | — | — | — | |
| Recursive-TextMASRecursion Round=r=2, Setting=Scaled2026.04 | 84.4 | — | 2,794 | — | 3,958 | — | |
| GPT-o3-miniAccess=Close-source2025.07 | 84.4 | — | — | — | — | — | |
| EXAONE-Deep-32BAccess=Open-source, Parameters=32B2025.07 | 84.38 | — | — | — | — | — | |
| Recursive-TextMASRecursion Round=r=1, Setting=Scaled2026.04 | 84.2 | — | 1,471 | — | 2,401 | — | |
| Gemma-3-27b-itAccess=Open-source, Parameters=27B2025.07 | 84 | — | — | — | — | — | |
| SoftThinkParam.=4B2025.11 | 83.2 | — | — | — | — | — | |
| StandardParam.=4B2025.11 | 82.8 | — | — | — | — | — | |
| DeepSeek-R1-Distill-Llama-70BAccess=Open-source, Parameters=70B2025.07 | 82.8 | — | — | — | — | — | |
| Qwen3-14BPrecision=BF162026.02 | 80.6 | — | — | — | — | — | |
| ACPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 80.48 | — | — | — | — | — | |
| ACPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 79.78 | — | — | — | — | — | |
| Eurus-2-7B-PRIMEModel Scale=7B2025.05 | 79.73 | — | — | — | — | 582.58 | |
| Qwen-2.5-72B-InstructAccess=Open-source, Parameters=72B2025.07 | 78.8 | — | — | — | — | — | |
| CISPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 78.57 | — | — | — | — | — | |
| SelfBudgeterModel Scale=1.5B2025.05 | 78.47 | — | — | — | — | 2,326.85 | |
| Qwen3-14BPrecision=FP4 w. Attn-QAT2026.02 | 78.4 | — | — | — | — | — | |
| DAPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 78.05 | — | — | — | — | — | |
| RecursiveMASRecursion Round=r=3, Setting=Light2026.04 | 77.8 | — | 519 | — | 1,360 | — | |
| High-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 76.88 | — | — | — | — | — | |
| L1-MaxSpecified Limit=3600 tokens2025.05 | 76.73 | — | — | — | — | 1,753.42 | |
| DAPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 76.72 | — | — | — | — | — | |
| RecursiveMASRecursion Round=r=2, Setting=Light2026.04 | 76.6 | — | 495 | — | 1,096 | — | |
| CISPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 76.3 | — | — | — | — | — | |
| RoutingParam.=4B2025.11 | 76.1 | — | — | — | — | — | |
| Low-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 75.85 | — | — | — | — | — | |
| RecursiveMASRecursion Round=r=1, Setting=Light2026.04 | 75.8 | — | 523 | — | 825 | — | |
| Qwen2.5-32b-InstructAccess=Open-source, Parameters=32B2025.07 | 75.6 | — | — | — | — | — | |
| High-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 75.22 | — | — | — | — | — | |
| Llama-3.3-Nemotron-Super-49B-v1Access=Open-source, Parameters=49B2025.07 | 75.2 | — | — | — | — | — | |
| DeepSeek-R1-Distill-QwenModel Scale=1.5B2025.05 | 74.93 | — | — | — | — | 5,327.12 | |
| GPT-4oAccess=Close-source2025.07 | 74.6 | — | — | — | — | — | |
| TaHParam.=1.7B2025.11 | 74.4 | — | — | — | — | — | |
| Claude-3.5-SonnetAccess=Close-source2025.07 | 74.2 | — | — | — | — | — | |
| AR-LoptiRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 73.75 | — | — | — | — | — | |
| Qwen2.5-Coder-32B-InstructAccess=Open-source, Parameters=32B2025.07 | 73.6 | — | — | — | — | — | |
| Claude-3.7-SonnetAccess=Close-source2025.07 | 73.2 | — | — | — | — | — | |
| TaH+Param.=1.7B2025.11 | 73 | — | — | — | — | — | |
| Llama-3.3-70B-InstructAccess=Open-source, Parameters=70B2025.07 | 73 | — | — | — | — | — | |
| HuatuoGPT-o1-72BAccess=Open-source, Parameters=72B2025.07 | 73 | — | — | — | — | — | |
| Recursive-TextMASRecursion Round=r=2, Setting=Light2026.04 | 72.5 | — | 2,117 | — | 2,204 | — | |
| E1-Math-1.5BTruncation Budget=4K, 1K2025.05 | 72.47 | — | — | — | — | 2,088.44 | |
| Low-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 72.47 | — | — | — | — | — | |
| Recursive-TextMASRecursion Round=r=1, Setting=Light2026.04 | 71.9 | — | 1,185 | — | 1,368 | — | |
| TeleChat2-35B-32KAccess=Open-source, Parameters=35B2025.07 | 70 | — | — | — | — | — | |
| Recursive-TextMASRecursion Round=r=3, Setting=Light2026.04 | 69.1 | — | 3,059 | — | 2,952 | — | |
| SoftThinkParam.=1.7B2025.11 | 68.8 | — | — | — | — | — | |
| StandardParam.=1.7B2025.11 | 68.4 | — | — | — | — | — | |
| AR-LoptiRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 63.92 | — | — | — | — | — | |
| AlwaysThinkParam.=1.7B2025.11 | 61.8 | — | — | — | — | — | |
| Qwen-2.5-7B-Simple-RLModel Scale=7B2025.05 | 61.13 | — | — | — | — | 823.89 | |
| RoutingParam.=1.7B2025.11 | 60 | — | — | — | — | — | |
| InternLM2.5-20B-ChatAccess=Open-source, Parameters=20B2025.07 | 55.2 | — | — | — | — | — | |
| TaH+Param.=0.6B2025.11 | 54.2 | — | — | — | — | — | |
| Llama3.1-70BPrecision=BF162026.02 | 53 | — | — | — | — | — | |
| Llama3.1-70BPrecision=FP4 w. Attn-QAT2026.02 | 51.2 | — | — | — | — | — | |
| TaHParam.=0.6B2025.11 | 51.2 | — | — | — | — | — | |
| SoftThinkParam.=0.6B2025.11 | 48.8 | — | — | — | — | — | |
| StandardParam.=0.6B2025.11 | 47.2 | — | — | — | — | — | |
| Base ModelRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@82026.06 | 41.48 | — | — | — | — | — | |
| ρ-EOSInitial Length=64, Threshold Configuration=Asym2026.01 | 40.6 | 558.7 | 682.2 | 81.9 | 1,968 | — | |
| Fixed-Length DenoisingSequence Length=10242026.01 | 40.4 | 585.8 | 1,024 | 57.2 | 3,663 | — | |
| Fixed-Length DenoisingSequence Length=20482026.01 | 40 | 706.5 | 2,048 | 34.5 | 12,764 | — | |
| DAEDALInitial Length=642026.01 | 40 | 464.6 | 618.3 | 75.2 | 2,207 | — | |
| Fixed-Length DenoisingSequence Length=5122026.01 | 38.4 | 423.9 | 512 | 82.8 | 1,202 | — | |
| ρ-EOSInitial Length=64, Threshold Configuration=Sym2026.01 | 37 | 428.8 | 486.3 | 88.2 | 1,398 | — | |
| E1-Math-1.5BTruncation Budget=0.5K, 1K2025.05 | 35.53 | — | — | — | — | 1,499.54 | |
| Fixed-Length DenoisingSequence Length=2562026.01 | 35.4 | 244.7 | 256 | 95.6 | 462 | — | |
| Instruct Model + GIFTShots=5-shot, Training Dataset=s1K, Tuning Method=LoRA Tuning2025.09 | 33 | — | — | — | — | — | |
| AlwaysThinkParam.=0.6B2025.11 | 32.8 | — | — | — | — | — | |
| Instruct Model + SFTShots=5-shot, Training Dataset=s1K, Tuning Method=LoRA Tuning2025.09 | 31.8 | — | — | — | — | — | |
| Instruct Model + GIFTShots=5-shot, Training Dataset=s1.1K, Tuning Method=LoRA Tuning2025.09 | 31.4 | — | — | — | — | — | |
| Instruct Model + SFTShots=5-shot, Training Dataset=s1.1K, Tuning Method=LoRA Tuning2025.09 | 30 | — | — | — | — | — | |
| Fixed-Length DenoisingSequence Length=1282026.01 | 29 | 123.3 | 128 | 96.3 | 208 | — | |
| RoutingParam.=0.6B2025.11 | 27.3 | — | — | — | — | — | |
| Fixed-Length DenoisingSequence Length=642026.01 | 24 | 61.7 | 64 | 96.4 | 98 | — |