Mathematical Reasoning on AIME 2025
95AccuracyGemini 3-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 3-Pro2026.02 | 95 | |
| GPT-5 (High)2026.02 | 94.6 | |
| GPT-5.12026.02 | 94 | |
| PRISMBase Model=Qwen3-30B-A3B, Zero-shot prompting=true, Thinking mode=false, Proposers=3, Reviewer=1, Synthesis iterations=32026.02 | 93.3 | |
| DMind-3Number of Parameters=21B2026.02 | 93.3 | |
| DS V3.2-Thinking2026.02 | 93.1 | |
| Agentic Proposingtraining_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@64, proposer=Agentic-Proposer-30B2026.02 | 91.6 | |
| Interfaze-Beta2026.02 | 90 | |
| PromptCoT 2.0training_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 89.8 | |
| DeepSeek V3.22026.02 | 89.3 | |
| ERNIE 5.02026.02 | 89.06 | |
| Gemini 2.5-Pro2026.02 | 88 | |
| Gemini 2.5 Pro2026.02 | 87.7 | |
| Claude Sonnet 4.52026.02 | 87 | |
| MoABase Model=Qwen3-30B-A3B, Zero-shot prompting=true, Thinking mode=false, Agents per layer=32026.02 | 86.7 | |
| Gemini 2.5 proEvaluation Protocol=pass@12025.09 | 86.7 | |
| OpenMathReasoningtraining_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 86.1 | |
| Qwen3-30B-A3B-Thinking-2507mode=zero-shot, evaluation=Mean@642026.02 | 85 | |
| OpenR1training_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 84.9 | |
| OpenThoughts-S3training_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 84.7 | |
| DMind-3-miniNumber of Parameters=4B2026.02 | 83.3 | |
| OpenCodeReasoningtraining_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 81.1 | |
| MiniMax M2.12026.02 | 81 | |
| o3-mini-highaccess=API only, examples_for_finetuning=N/A2025.01 | 80.9 | |
| Qwen3-235B-A22BModel Category=Large Language Models, Model Scale=235B-A22B, Reasoning Strategy=Thinking2025.12 | 80.78 | |
| Two HeadsBase Model=Qwen3-30B-A3B, Zero-shot prompting=true, Thinking mode=false, Solvers=K=32026.02 | 80 | |
| Majority Voting (Shortest-K)Model=Qwen3-14B, K=8, Strategy=Shortest-K Merge2025.12 | 80 | |
| FIGR2025.12 | 79.32 | |
| THINKMERGE Shortest-K Merge (D)Model=Qwen3-14B, K=8, Strategy=Shortest-K Merge2025.12 | 78.7 | |
| Majority Voting (Shortest-K)Model=Qwen3-14B, K=4, Strategy=Shortest-K Merge2025.12 | 78 | |
| THINKMERGE DirectMerge (A)Model=Qwen3-14B, K=8, Strategy=All-Reduce2025.12 | 78 | |
| THINKMERGE Early-Ready (C)Model=Qwen3-14B, K=8, Strategy=Early-Ready2025.12 | 78 | |
| Claude Opus 4.1Evaluation Protocol=pass@12025.09 | 78 | |
| Majority Voting (Early-Ready)Model=Qwen3-14B, K=8, Strategy=Early-Ready2025.12 | 77.4 | |
| DeepSeek-V3.2Type=Single-model reference, Zero-shot prompting=true, Extended reasoning (thinking mode)=true2026.02 | 76.8 | |
| Majority Voting (Early-Ready)Model=Qwen3-14B, K=4, Strategy=Early-Ready2025.12 | 76 | |
| THINKMERGE Shortest-K Merge (D)Model=Qwen3-14B, K=4, Strategy=Shortest-K Merge2025.12 | 76 | |
| Majority Voting (Shortest-K)Model=Qwen3-14B, K=2, Strategy=Shortest-K Merge2025.12 | 75.3 | |
| Majority Voting (Shortest-K)Model=Qwen3-4B, K=4, Strategy=Shortest-K Merge2025.12 | 75.3 | |
| Majority Voting (Shortest-K)Model=Qwen3-4B, K=8, Strategy=Shortest-K Merge2025.12 | 75.3 | |
| THINKMERGE Shortest-K Merge (D)Model=Qwen3-14B, K=2, Strategy=Shortest-K Merge2025.12 | 74.7 | |
| Claude Sonnet 4Reasoning=Thinking2026.02 | 74.3 | |
| Majority VotingModel=Qwen3-14B, K=8, Strategy=All-Reduce2025.12 | 74 | |
| Qwen3-235B-A22BType=Single-model reference, Zero-shot prompting=true, Thinking mode=false2026.02 | 73.3 | |
| Claude Opus 4Reasoning=Thinking2026.02 | 73.3 | |
| THINKMERGE Early-Ready (C)Model=Qwen3-14B, K=2, Strategy=Early-Ready2025.12 | 73.3 | |
| Majority VotingModel=Qwen3-14B, K=4, Strategy=All-Reduce2025.12 | 73.3 | |
| THINKMERGE Trimming (B)Model=Qwen3-14B, K=4, Strategy=All-Reduce2025.12 | 73.3 | |
| THINKMERGE Early-Ready (C)Model=Qwen3-14B, K=4, Strategy=Early-Ready2025.12 | 73.3 | |
| Majority Voting (Early-Ready)Model=Qwen3-4B, K=8, Strategy=Early-Ready2025.12 | 73.3 | |
| THINKMERGE Trimming (B)Model=Qwen3-14B, K=8, Strategy=All-Reduce2025.12 | 73.3 | |
| Qwen3-32BModel Category=Large Language Models, Model Scale=32B, Reasoning Strategy=Thinking2025.12 | 72.9 | |
| THINKMERGE Trimming (B)Model=Qwen3-14B, K=2, Strategy=All-Reduce2025.12 | 72.7 | |
| Majority Voting (Early-Ready)Model=Qwen3-4B, K=4, Strategy=Early-Ready2025.12 | 72.7 | |
| THINKMERGE Early-Ready (C)Model=Qwen3-4B, K=4, Strategy=Early-Ready2025.12 | 72.7 | |
| THINKMERGE Shortest-K Merge (D)Model=Qwen3-4B, K=8, Strategy=Shortest-K Merge2025.12 | 72.7 | |
| THINKMERGE DirectMerge (A)Model=Qwen3-14B, K=2, Strategy=All-Reduce2025.12 | 72 | |
| Majority Voting (Early-Ready)Model=Qwen3-14B, K=2, Strategy=Early-Ready2025.12 | 72 | |
| THINKMERGE DirectMerge (A)Model=Qwen3-4B, K=4, Strategy=All-Reduce2025.12 | 72 | |
| THINKMERGE DirectMerge (A)Model=Qwen3-14B, K=4, Strategy=All-Reduce2025.12 | 72 | |
| THINKMERGE Early-Ready (C)Model=Qwen3-4B, K=8, Strategy=Early-Ready2025.12 | 70.8 | |
| Majority Voting (Shortest-K)Model=Qwen3-4B, K=2, Strategy=Shortest-K Merge2025.12 | 70.7 | |
| Majority VotingModel=Qwen3-14B, K=2, Strategy=All-Reduce2025.12 | 70.7 | |
| o3-mini-mediumaccess=API only, examples_for_finetuning=N/A2025.01 | 70.4 | |
| r1access=Open Weights, examples_for_finetuning=>800K2025.01 | 70 | |
| ReConcileBase Model=Qwen3-30B-A3B, Zero-shot prompting=true, Thinking mode=false, Agents=3, Discussion rounds=22026.02 | 70 | |
| Qwen3-30B-A3BType=Single-model reference, Zero-shot prompting=true, Thinking mode=false2026.02 | 70 | |
| R1# Examples=>>800K2025.12 | 70 | |
| THINKMERGE DirectMerge (A)Model=Qwen3-4B, K=8, Strategy=All-Reduce2025.12 | 70 | |
| THINKMERGE Shortest-K Merge (D)Model=Qwen3-4B, K=4, Strategy=Shortest-K Merge2025.12 | 69.3 | |
| Text-only RLMode=Text-only, Reasoning Strategy=RL2025.12 | 69.22 | |
| Majority VotingModel=Qwen3-4B, K=8, Strategy=All-Reduce2025.12 | 68.7 | |
| THINKMERGE Trimming (B)Model=Qwen3-4B, K=8, Strategy=All-Reduce2025.12 | 68.7 | |
| Majority VotingModel=Qwen3-4B, K=4, Strategy=All-Reduce2025.12 | 68 | |
| THINKMERGE Trimming (B)Model=Qwen3-4B, K=4, Strategy=All-Reduce2025.12 | 68 | |
| GLM-4.5VModel Category=Large Vision-Language Models, Model Scale=108B2025.12 | 67.34 | |
| THINKMERGE DirectMerge (A)Model=Qwen3-4B, K=2, Strategy=All-Reduce2025.12 | 66.7 | |
| Majority Voting (Early-Ready)Model=Qwen3-4B, K=2, Strategy=Early-Ready2025.12 | 66.7 | |
| THINKMERGE Early-Ready (C)Model=Qwen3-4B, K=2, Strategy=Early-Ready2025.12 | 66.7 | |
| Qwen3-VL-32B-InstructModel Category=Large Vision-Language Models, Model Scale=32B, Reasoning Strategy=Instruct2025.12 | 66.2 | |
| THINKMERGE Trimming (B)Model=Qwen3-4B, K=2, Strategy=All-Reduce2025.12 | 66 | |
| THINKMERGE Shortest-K Merge (D)Model=Qwen3-4B, K=2, Strategy=Shortest-K Merge2025.12 | 65.3 | |
| Majority VotingModel=Qwen3-4B, K=2, Strategy=All-Reduce2025.12 | 63.3 | |
| JustRL-NemotronBackbone=OpenMath-Nemotron-1.5B, Sampling Strategy (@k)=@32, Dynamic Sampling=false, Training Steps=3440, Train Batch Size=256, Rollout N=8, Max Context Length=16k, Token Budget=1.1x10^8k2025.12 | 62.92 | |
| QuestABackbone=OpenMath-Nemotron-1.5B, Sampling Strategy (@k)=@32, Dynamic Sampling=true, Training Steps=2000, Train Batch Size=128, Rollout N=16, Max Context Length=32k, Token Budget=2.6x10^8k2025.12 | 62.08 | |
| Gemini 2.5 Flash2026.02 | 60.3 | |
| Self-ConsistencyBase Model=Qwen3-30B-A3B, Zero-shot prompting=true, Thinking mode=false, Sampling=K=5 paths2026.02 | 56.7 | |
| r1-distill-Llama-70Baccess=Open Weights, examples_for_finetuning=800K2025.01 | 56.3 | |
| R1-distill-Llama-70B# Examples=800K2025.12 | 56.3 | |
| s1K-1.1 + AIR-Step# Examples=1K, Distillation Source=Deepseek R12025.12 | 53.33 | |
| Majority Voting (Shortest-K)Model=R1-Distill-Qwen-7B, K=8, Strategy=Shortest-K Merge2025.12 | 52.7 | |
| THINKMERGE Shortest-K Merge (D)Model=R1-Distill-Qwen-7B, K=8, Strategy=Shortest-K Merge2025.12 | 52.7 | |
| Majority Voting (Shortest-K)Model=R1-Distill-Qwen-7B, K=4, Strategy=Shortest-K Merge2025.12 | 52 | |
| Skill-centric distillation frameworkBase Model=Qwen3-4B, SFT Setting=1K2026.01 | 50.8 | |
| BaseBase Model=Qwen3-4B, SFT Setting=1K2026.01 | 50.7 | |
| Majority Voting (Shortest-K)Model=R1-Distill-Qwen-7B, K=2, Strategy=Shortest-K Merge2025.12 | 50.7 | |
| THINKMERGE Shortest-K Merge (D)Model=R1-Distill-Qwen-7B, K=4, Strategy=Shortest-K Merge2025.12 | 50.7 | |
| RandomBase Model=Qwen3-4B, SFT Setting=1K2026.01 | 50.3 | |
| s1Base Model=Qwen3-4B, SFT Setting=1K, Data Selection Mode=online2026.01 | 50.2 | |
| s1.1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=None2025.01 | 50 |