Mathematical Reasoning on AIME24 (test)
98.9Pass@1 ScoreMiroThinker-v1.5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MiroThinker-v1.5Size=30B, # Reas. Tokens=11295.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 98.9 | — | |
| GPT-5.4-xhighSize=—, # Reas. Tokens=8810.3, Reasoning Paradigm=Reasoning LLMs2026.05 | 96.4 | — | |
| SR2AM-v1.0-30BSize=30B, # Reas. Tokens=5517.7, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 96.2 | — | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=9306.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 95.4 | — | |
| GPT-5.4-xhighSize=—, # Reas. Tokens=4821.8, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 95.2 | — | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=3011.5, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 95.1 | — | |
| K2-Think-V2-highSize=73B, # Reas. Tokens=31905.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 93.8 | — | |
| ASearcher-Web-QWQ-v2Size=32B, # Reas. Tokens=116752.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 92.2 | — | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=8269.1, Reasoning Paradigm=Reasoning LLMs2026.05 | 91.3 | — | |
| Kimi-K2.5Size=1024B, # Reas. Tokens=6413.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 89.6 | — | |
| Tongyi-DeepResearchSize=30B, # Reas. Tokens=7431.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 89.2 | — | |
| SR2AM-v0.1-8BSize=8B, # Reas. Tokens=3697.6, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 83.8 | — | |
| GPT-OSS-120B-highSize=120B, # Reas. Tokens=2700.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 79.9 | — | |
| WebExplorer-8BSize=8B, # Reas. Tokens=3616.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 79.5 | — | |
| Qwen3-235BSize=235B, # Reas. Tokens=6467.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 75.5 | — | |
| w/o MergingModels=Math2026.02 | 74.27 | — | |
| SCF-RKLModels=Fuse2026.02 | 73.96 | — | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=5410.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 73.9 | — | |
| WebSailor-32BSize=32B, # Reas. Tokens=1055.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 72.9 | — | |
| w/o MergingModels=Code2026.02 | 72.5 | — | |
| GLM-4.6Size=357B, # Reas. Tokens=3580.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 71.7 | — | |
| A2FMSize=32B, # Reas. Tokens=23424.8, Reasoning Paradigm=Mode Routing2026.05 | 70.3 | — | |
| SCEModels=Fuse2026.02 | 65.62 | — | |
| Ties MergingModels=Fuse2026.02 | 63.23 | — | |
| Dare Task ArithmeticModels=Fuse2026.02 | 62.92 | — | |
| Task ArithmeticModels=Fuse2026.02 | 61.98 | — | |
| Dare Ties MergingModels=Fuse2026.02 | 61.88 | — | |
| WebSailor-7BSize=7B, # Reas. Tokens=2211.5, Reasoning Paradigm=Unregulated Deliberation2026.05 | 60.6 | — | |
| RAgent-QwQ-32BReasoning Strategy=RAG Agent2025.01 | 56.7 | — | |
| Search-o1Reasoning Strategy=Reason-in-Documents2025.01 | 56.7 | — | |
| QwQ-32BReasoning Strategy=Direct Reasoning2025.01 | 53.3 | — | |
| DeepSeek-R1-LiteReasoning Strategy=Direct Reasoning2025.01 | 52.5 | — | |
| RAG-QwQ-32BReasoning Strategy=Standard RAG2025.01 | 50 | — | |
| SimpleTIR-32BSize=32B, # Reas. Tokens=5174.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 49.2 | — | |
| o1-previewReasoning Strategy=Direct Reasoning2025.01 | 44.6 | — | |
| DeepSeek-R1-Distill-Qwen-7BModel Scale=7B2026.04 | 43.3 | 7,891.9 | |
| AFM-Code-7B-RLSize=7B, # Reas. Tokens=11205.5, Reasoning Paradigm=Workflow Distillation2026.05 | 39.7 | — | |
| Llama3.3-70BReasoning Strategy=Direct Reasoning2025.01 | 36.7 | — | |
| Task ArithmeticModel Scale=7B, Merging Strategy=Arithmetic Merging2026.04 | 36.7 | 6,580.9 | |
| Evo-L2S (Accuracy)Model Scale=7B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 36.7 | 6,674.3 | |
| Evo-L2S-01Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 36.7 | 6,674.3 | |
| Evo-L2S-02Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 33.3 | 4,948.4 | |
| SimpleTIR-7BSize=7B, # Reas. Tokens=3551.7, Reasoning Paradigm=Unregulated Deliberation2026.05 | 33.3 | — | |
| RAG-Qwen2.5-32BReasoning Strategy=Standard RAG2025.01 | 30 | — | |
| ACM-TAModel Scale=7B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 30 | 3,898.1 | |
| Evo-L2S-03Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 30 | 3,140.9 | |
| AFM-Web-7B-RLSize=7B, # Reas. Tokens=2608.6, Reasoning Paradigm=Workflow Distillation2026.05 | 24.8 | — | |
| Qwen2.5-32BReasoning Strategy=Direct Reasoning2025.01 | 23.3 | — | |
| TIES-MergingModel Scale=7B, Merging Strategy=Arithmetic Merging2026.04 | 23.3 | 4,266.5 | |
| Evo-L2S-04Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 23.3 | 3,368.4 | |
| Qwen2.5-Coder-32BReasoning Strategy=Direct Reasoning2025.01 | 20 | — | |
| Qwen2.5-72BReasoning Strategy=Direct Reasoning2025.01 | 20 | — | |
| RAgent-Qwen2.5-32BReasoning Strategy=RAG Agent2025.01 | 20 | — | |
| ACM-AverageModel Scale=7B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 20 | 2,951.5 | |
| Evo-L2S-05Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 20 | 2,006.6 | |
| Average MergingModel Scale=7B, Merging Strategy=Arithmetic Merging2026.04 | 16.7 | 3,710.7 | |
| ACM-TIESModel Scale=7B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 16.7 | 3,118.6 | |
| Evo-L2S (Length)Model Scale=7B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 16.7 | 2,038.9 | |
| ASearcher-Web-7BSize=7B, # Reas. Tokens=601.4, Reasoning Paradigm=Unregulated Deliberation2026.05 | 12.9 | — | |
| GPT-4oReasoning Strategy=Direct Reasoning2025.01 | 9.3 | — | |
| Qwen2.5-Math-7BModel Scale=7B2026.04 | 0 | 1,450 |