Mathematical Reasoning on Omni-MATH
78.5AccuracyConfident Decoding
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Confident DecodingModel=Qwen3.5-122B-A10B, Decoding Strategy=Confident (Ours)2026.06 | 78.5 | — | — | |
| Last LayerModel=Qwen3.5-122B-A10B, Decoding Strategy=Last Layer2026.06 | 78.3 | — | — | |
| Confident DecodingModel=Qwen3.5-27B, Decoding Strategy=Confident (Ours)2026.06 | 76.2 | — | — | |
| Last LayerModel=Qwen3.5-27B, Decoding Strategy=Last Layer2026.06 | 76 | — | — | |
| Confident DecodingModel=Qwen3.5-35B-A3B, Decoding Strategy=Confident (Ours)2026.06 | 73 | — | — | |
| Last LayerModel=Qwen3.5-35B-A3B, Decoding Strategy=Last Layer2026.06 | 72.3 | — | — | |
| Confident DecodingModel=gpt-oss-120B, Decoding Strategy=Confident (Ours)2026.06 | 71 | — | — | |
| Last LayerModel=gpt-oss-120B, Decoding Strategy=Last Layer2026.06 | 70.2 | — | — | |
| Confident DecodingModel=Gemma-4-31B, Decoding Strategy=Confident (Ours)2026.06 | 69 | — | — | |
| Last LayerModel=Gemma-4-31B, Decoding Strategy=Last Layer2026.06 | 68.3 | — | — | |
| ODA-Math-460kBackbone=Qwen3-8B-Base, Training Dataset Size=460k2025.12 | 66.9 | — | — | |
| AM-Thinking (math)Backbone=Qwen3-8B-Base, Training Dataset Size=558k2025.12 | 64.5 | — | — | |
| ODA-Math-460kBackbone=Qwen2.5-7B-Base, Training Dataset Size=460k2025.12 | 62.6 | — | — | |
| Last LayerModel=gpt-oss-20b, Decoding Strategy=Last Layer2026.06 | 61.3 | — | — | |
| Confident DecodingModel=gpt-oss-20b, Decoding Strategy=Confident (Ours)2026.06 | 61 | — | — | |
| AM-Thinking (math)Backbone=Qwen2.5-7B-Base, Training Dataset Size=558k2025.12 | 60.6 | — | — | |
| OmniThought-0528Backbone=Qwen3-8B-Base, Training Dataset Size=365k2025.12 | 59 | — | — | |
| SYNTHETIC-2-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=105k2025.12 | 58.8 | — | — | |
| Agent 1 (Qwen3-30B-A3B-Instruct)Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 55.1 | — | — | |
| Agent 1 (Qwen3-30B-A3B-Instruct)Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 55.1 | — | — | |
| SYNTHETIC-2-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=105k2025.12 | 54.5 | — | — | |
| MiroMind-M1-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=719k2025.12 | 54.5 | — | — | |
| OmniThought-0528Backbone=Qwen2.5-7B-Base, Training Dataset Size=365k2025.12 | 54.3 | — | — | |
| Iterative Critique-and-Routing ControllerController=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 54.1 | — | — | |
| Iterative Critique-and-Routing ControllerController=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 53.4 | — | — | |
| DyTopoBackbone=MiMo-V2-Flash2026.02 | 52.86 | — | — | |
| SKILL-MOEProfile From=AIME2025.03 | 52.03 | — | — | |
| DyTopoBackbone=Qwen3-8B2026.02 | 51.43 | — | — | |
| Router-R1Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 49.5 | — | — | |
| SKILL-MOEProfile From=MMLU-Pro2025.03 | 49.32 | — | — | |
| Router-R1Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 49.2 | — | — | |
| Self-MoAProfile From=AIME2025.03 | 48.75 | — | — | |
| Light-R1-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=79k2025.12 | 48.5 | — | — | |
| MiroMind-M1-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=719k2025.12 | 48.1 | — | — | |
| Bidirectional Curriculum Generation (Round 3)Data Volume=4,5942026.03 | 47.42 | — | — | |
| MoAProfile From=AIME2025.03 | 47.36 | — | — | |
| Bidirectional Curriculum Generation (Round 4)Data Volume=5,8732026.03 | 46.43 | — | — | |
| RouterDCController=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 46.3 | — | — | |
| RoBERTa RouterController=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 45.8 | — | — | |
| DeepMath-103KBackbone=Qwen2.5-7B-Base, Training Dataset Size=309k2025.12 | 45.4 | — | — | |
| OpenThoughts3Backbone=Qwen2.5-7B-Base, Training Dataset Size=1.2M2025.12 | 44.8 | — | — | |
| RouterDCController=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 44.5 | — | — | |
| AgentScopeBackbone=MiMo-V2-Flash2026.02 | 44.28 | — | — | |
| RoBERTa RouterController=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 43.6 | — | — | |
| Light-R1-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=79k2025.12 | 43.3 | — | — | |
| ASCModel=GEMMA-3-27B2026.01 | 43 | 384.9 | 0.11 | |
| DebateProfile From=AIME2025.03 | 42.93 | — | — | |
| SCModel=GEMMA-3-27B, k=162026.01 | 42.9 | 585.84 | 0.07 | |
| ESCModel=GEMMA-3-27B, w=42026.01 | 42.8 | 408.31 | 0.1 | |
| ReConcileProfile From=AIME2025.03 | 42.62 | — | — | |
| ReASC (online)Model=GEMMA-3-27B2026.01 | 42.5 | 352.77 | 0.12 | |
| Random TopologyBackbone=MiMo-V2-Flash2026.02 | 41.43 | — | — | |
| DyTopoBackbone=GPT-oss-120B2026.02 | 41.43 | — | — | |
| Fast-Math-R-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=8k2025.12 | 39.6 | — | — | |
| Fast-MathData Volume=7.9K2026.03 | 39.6 | — | — | |
| pass@1Model=GEMMA-3-27B2026.01 | 37.5 | — | — | |
| Single-turn AgentBackbone=MiMo-V2-Flash2026.02 | 37.14 | — | — | |
| AgentScopeBackbone=GPT-oss-120B2026.02 | 37.14 | — | — | |
| Raiden-DeepSeek-R1Data Volume=62K2026.03 | 36.34 | — | — | |
| Fast-Math-R1-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=8k2025.12 | 35.8 | — | — | |
| MegaScience (math)Backbone=Qwen3-8B-Base, Training Dataset Size=414k2025.12 | 35.8 | — | — | |
| MegaScienceData Volume=1.25M2026.03 | 35.8 | — | — | |
| AgentScopeBackbone=Qwen3-8B2026.02 | 35.71 | — | — | |
| DebateProfile From=MMLU-Pro2025.03 | 34.51 | — | — | |
| Random TopologyBackbone=GPT-oss-120B2026.02 | 34.29 | — | — | |
| Bidirectional Curriculum Generation (Round 2)Data Volume=1,6332026.03 | 34.03 | — | — | |
| ASCModel=QWEN-2.5-7B2026.01 | 33.3 | 80.24 | 0.41 | |
| SCModel=QWEN-2.5-7B, k=162026.01 | 33.1 | 101.55 | 0.33 | |
| ESCModel=QWEN-2.5-7B, w=42026.01 | 33.1 | 83.97 | 0.39 | |
| LLM OutputBackbone=MiMo-V2-Flash2026.02 | 32.86 | — | — | |
| Single-turn AgentBackbone=Qwen3-8B2026.02 | 32.86 | — | — | |
| Controller V2Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 32.8 | — | — | |
| ReASC (online)Model=QWEN-2.5-7B2026.01 | 32.7 | 70.95 | 0.46 | |
| MoAProfile From=MMLU-Pro2025.03 | 31.55 | — | — | |
| Qwen3-8B-BaseBackbone=Qwen3-8B-Base2025.12 | 30.6 | — | — | |
| Qwen3-8B-baseData Volume=-2026.03 | 30.6 | — | — | |
| QWQ-LongCoTData Volume=130K2026.03 | 30.6 | — | — | |
| ReASC (online)Model=GEMMA-3-4B2026.01 | 30.5 | 62.2 | 0.49 | |
| Random RouterController=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 30.4 | — | — | |
| ASCModel=GEMMA-3-4B2026.01 | 30.2 | 65.9 | 0.46 | |
| DyTopoBackbone=Llama3-8B-Instruct2026.02 | 30 | — | — | |
| ESCModel=GEMMA-3-4B, w=42026.01 | 30 | 69.08 | 0.43 | |
| SCModel=GEMMA-3-4B, k=162026.01 | 29.9 | 90.36 | 0.33 | |
| Bidirectional Curriculum Generation (Round 1)Data Volume=8502026.03 | 29.29 | — | — | |
| MegaScience (math)Backbone=Qwen2.5-7B-Base, Training Dataset Size=414k2025.12 | 28.7 | — | — | |
| pass@1Model=QWEN-2.5-7B2026.01 | 27.6 | — | — | |
| MATHFusionData Volume=74732026.03 | 27.46 | — | — | |
| ReASC (online)Model=QWEN-2.5-3B2026.01 | 27.3 | 33.29 | 0.82 | |
| ASCModel=QWEN-2.5-3B2026.01 | 27.2 | 36.69 | 0.74 | |
| SCModel=QWEN-2.5-3B, k=162026.01 | 27 | 43.84 | 0.62 | |
| ESCModel=QWEN-2.5-3B, w=42026.01 | 27 | 38.58 | 0.7 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B-Base2025.12 | 26 | — | — | |
| Single-turn AgentBackbone=GPT-oss-120B2026.02 | 25.71 | — | — | |
| Random TopologyBackbone=Qwen3-8B2026.02 | 25.71 | — | — | |
| Controller V1Controller=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 25.5 | — | — | |
| Agent 2 (Qwen2.5-7B-Instruct)Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 25.4 | — | — | |
| OpenO1-SFTData Volume=77K2026.03 | 25.34 | — | — | |
| pass@1Model=GEMMA-3-4B2026.01 | 25.2 | — | — | |
| Controller V2Controller=Qwen2.5-7B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Qwen2.5-7B-Instruct, Agent 3=Qwen2.5-1.5B-Instruct2026.05 | 24.6 | — | — | |
| Random RouterController=Qwen3-4B-Base, Agent 1=Qwen3-30B-A3B-Instruct, Agent 2=Ministral-3-8B-Instruct, Agent 3=Llama-3-2-1B-Instruct2026.05 | 24.4 | — | — |