Mathematical Reasoning on AIME 2024
94AccuracyGPT-5-Mini-R
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5-Mini-R2026.03 | 94 | — | — | |
| Agentic Proposingtraining_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@64, proposer=Agentic-Proposer-30B2026.02 | 93.5 | — | — | |
| WSC-GMM*Model=DeepSeek-R1-8B, SelfStepConf=true2026.03 | 93.33 | — | — | |
| GPT-5-Mini2026.03 | 93 | — | — | |
| PromptCoT 2.0training_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 92.1 | — | — | |
| WSC-GMM*Model=Qwen3-32B, Thinking mode=false, SelfStepConf=true2026.03 | 90.16 | — | — | |
| PG@16Model=Deepseek-R1-Distill-Qwen32B2026.03 | 90 | — | — | |
| Gemini 2.5 proEvaluation Protocol=pass@12025.09 | 88.7 | — | — | |
| OpenMathReasoningtraining_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 87.9 | — | — | |
| Qwen3-30B-A3B-Thinking-2507mode=zero-shot, evaluation=Mean@642026.02 | 87.7 | — | — | |
| SC@16Model=Deepseek-R1-Distill-Qwen32B2026.03 | 86.67 | — | — | |
| SCModel=DeepSeek-R1-8B2026.03 | 86.67 | — | — | |
| OpenR1training_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 86.3 | — | — | |
| OpenThoughts-S3training_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 85.7 | — | — | |
| OpenCodeReasoningtraining_budget=11,000 mixed trajectories, recipe=GRPO, evaluation=Mean@642026.02 | 85 | — | — | |
| o3-mini-highaccess=API only, examples_for_finetuning=N/A2025.01 | 83.8 | — | — | |
| Qwen3-235B-A22BModel Category=Large Language Models, Model Scale=235B-A22B, Reasoning Strategy=Thinking2025.12 | 83.8 | — | — | |
| SwiRBackbone=Qwen3-32B2025.10 | 82.92 | — | — | |
| Qwen3-32BModel Category=Large Language Models, Model Scale=32B, Reasoning Strategy=Thinking2025.12 | 81.4 | — | — | |
| CoTBackbone=Qwen3-32B2025.10 | 80.42 | — | — | |
| MultiRole-R1Model Backbone=Qwen3-8B2025.07 | 80.1 | — | — | |
| CoT (Greedy)Backbone=Qwen3-32B2025.10 | 80 | — | — | |
| r1access=Open Weights, examples_for_finetuning=>800K2025.01 | 79.8 | — | — | |
| R1# Examples=>>800K2025.12 | 79.8 | — | — | |
| SFT+GRPOModel Backbone=Qwen3-8B2025.07 | 79.6 | — | — | |
| FIGR2025.12 | 79.58 | — | — | |
| SwiRBackbone=Qwen3-8B2025.10 | 79.17 | — | — | |
| More thinkModel Backbone=Qwen3-8B2025.07 | 78.8 | — | — | |
| SFTModel Backbone=Qwen3-8B2025.07 | 78.3 | — | — | |
| Self-RefineModel Backbone=Qwen3-8B2025.07 | 77.5 | — | — | |
| Role-PlayModel Backbone=Qwen3-8B2025.07 | 76.6 | — | — | |
| BLASSTBackbone=Qwen3-8B, Attention Method=BLASST, Sparsity=~50%, Phase=Decode2025.12 | 76.5 | — | — | |
| BLASSTModel=Qwen3-8B, Sparsity=~50%, Deployment Phase=Decode Phase2025.12 | 76.5 | — | — | |
| GLM-4.5VModel Category=Large Vision-Language Models, Model Scale=108B2025.12 | 76.2 | — | — | |
| Zero-ShotModel Backbone=Qwen3-8B2025.07 | 76 | — | — | |
| CoTBackbone=Qwen3-8B2025.10 | 75.83 | — | — | |
| o3-mini-mediumaccess=API only, examples_for_finetuning=N/A2025.01 | 75.8 | — | — | |
| BLASSTModel=Qwen3-8B, Sparsity=~75%, Deployment Phase=Decode Phase2025.12 | 75.33 | — | — | |
| Dense AttentionBackbone=Qwen3-8B, Attention Method=Dense, Phase=Decode2025.12 | 75 | — | — | |
| Dense AttentionModel=Qwen3-8B, Sparsity=Dense, Deployment Phase=Decode Phase2025.12 | 75 | — | — | |
| Soft ThinkingBackbone=Qwen3-32B2025.10 | 74.58 | — | — | |
| RocketKVBackbone=Qwen3-8B, Attention Method=RocketKV, Phase=Decode2025.12 | 73.54 | — | — | |
| Qwen3-VL-32B-InstructModel Category=Large Vision-Language Models, Model Scale=32B, Reasoning Strategy=Instruct2025.12 | 73.33 | — | — | |
| Text-only RLMode=Text-only, Reasoning Strategy=RL2025.12 | 73.33 | — | — | |
| MultiRole-R1Model Backbone=R-D-Qwen-14B2025.07 | 73.3 | — | — | |
| SFT+GRPOModel Backbone=R-D-Qwen-14B2025.07 | 72.8 | — | — | |
| Avg@16Model=Deepseek-R1-Distill-Qwen32B2026.03 | 72.6 | — | — | |
| QuestBackbone=Qwen3-8B, Attention Method=Quest, Phase=Decode2025.12 | 71.5 | — | — | |
| More thinkModel Backbone=R-D-Qwen-14B2025.07 | 71.4 | — | — | |
| Self-RefineModel Backbone=R-D-Qwen-14B2025.07 | 70.6 | — | — | |
| SFTModel Backbone=R-D-Qwen-14B2025.07 | 70.2 | — | — | |
| CoT (Greedy)Backbone=Qwen3-8B2025.10 | 70 | — | — | |
| Zero-ShotModel Backbone=R-D-Qwen-14B2025.07 | 69.7 | — | — | |
| Role-PlayModel Backbone=R-D-Qwen-14B2025.07 | 69.1 | — | — | |
| Soft ThinkingBackbone=Qwen3-8B2025.10 | 67.92 | — | — | |
| s1K-1.1 + AIR-Step# Examples=1K, Distillation Source=Deepseek R12025.12 | 66.67 | — | — | |
| MultiRole-R1Model Backbone=R-D-Qwen-7B2025.07 | 63.2 | — | — | |
| TTRL-GTModel=Qwen2.5-7B-Base2026.03 | 62.71 | — | — | |
| SFT+GRPOModel Backbone=R-D-Qwen-7B2025.07 | 62.7 | — | — | |
| DeepSeek-R1-Distill-Qwen-7B + ERC-DAPOModel Backbone=Qwen-7B, Training Algorithm=ERC-DAPO2025.12 | 62.1 | — | — | |
| DeepSeek-R1-Distill-Qwen-7B + DAPOModel Backbone=Qwen-7B, Training Algorithm=DAPO2025.12 | 62 | — | — | |
| r1-distill-Qwen-14Baccess=Open Weights, examples_for_finetuning=800K2025.01 | 61.7 | — | — | |
| R1-distill-Qwen-14B# Examples=800K2025.12 | 61.7 | — | — | |
| Qwen3-VL-8B-InstructModel Category=Large Vision-Language Models, Model Scale=8B, Reasoning Strategy=Instruct2025.12 | 61.46 | — | — | |
| SFTModel Backbone=R-D-Qwen-7B2025.07 | 58.9 | — | — | |
| More thinkModel Backbone=R-D-Qwen-7B2025.07 | 58.6 | — | — | |
| r1-distill-Qwen-32Baccess=Open Weights, examples_for_finetuning=800K2025.01 | 58.3 | — | — | |
| R1-distill-Qwen-32B# Examples=800K2025.12 | 58.3 | — | — | |
| MultiRole-R1Model Backbone=R-D-Llama-8B2025.07 | 58.1 | — | — | |
| PACS-8BEvaluation Protocol=pass@1, Backbone=Qwen3-8B2025.09 | 57.58 | — | — | |
| r1-distill-Llama-70Baccess=Open Weights, examples_for_finetuning=800K2025.01 | 57.1 | — | — | |
| R1-distill-Llama-70B# Examples=800K2025.12 | 57.1 | — | — | |
| SFTModel Backbone=R-D-Llama-8B2025.07 | 56.8 | — | — | |
| s1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 4x2025.01 | 56.7 | — | — | |
| s1.1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=None2025.01 | 56.7 | — | — | |
| s1.1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 1x2025.01 | 56.7 | — | — | |
| s1.1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 2x2025.01 | 56.7 | — | — | |
| s1K-1.1# Examples=1K, Distillation Source=Deepseek R12025.12 | 56.7 | — | — | |
| AIR-Sample# Examples=1K, Distillation Source=Deepseek R12025.12 | 56.7 | — | — | |
| SFT+GRPOModel Backbone=R-D-Llama-8B2025.07 | 56.7 | — | — | |
| DCPOBackbone=Qwen3-4B, Optimization Method=DCPO, Sampling Strategy=x322026.01 | 56.6 | — | — | |
| o3-mini-lowaccess=API only, examples_for_finetuning=N/A2025.01 | 56.3 | — | — | |
| LIMOaccess=Open Weights and Open Data, examples_for_finetuning=8172025.01 | 56.3 | — | — | |
| Role-PlayModel Backbone=R-D-Qwen-7B2025.07 | 56.3 | — | — | |
| Self-RefineModel Backbone=R-D-Qwen-7B2025.07 | 55.9 | — | — | |
| Zero-ShotModel Backbone=R-D-Qwen-7B2025.07 | 55.5 | — | — | |
| DeepSeek-R1-Distill-Qwen-7B + GRPOModel Backbone=Qwen-7B, Training Algorithm=GRPO2025.12 | 55.3 | — | — | |
| PACS-4BEvaluation Protocol=pass@1, Backbone=Qwen3-4B2025.09 | 55.1 | — | — | |
| DeepSeek-R1-Distill-Qwen-7BModel Backbone=Qwen-7B, Training Algorithm=Baseline2025.12 | 54.5 | — | — | |
| AEPOBackbone=Qwen3-4B, Optimization Method=AEPO, Sampling Strategy=x322026.01 | 54.5 | — | — | |
| More thinkModel Backbone=R-D-Llama-8B2025.07 | 54 | — | — | |
| Role-PlayModel Backbone=R-D-Llama-8B2025.07 | 53.4 | — | — | |
| s1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 1x2025.01 | 53.3 | — | — | |
| s1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 2x2025.01 | 53.3 | — | — | |
| RLOOBackbone=Qwen-3-32B, Context length=4K2026.03 | 53 | — | 55 | |
| GRPOBackbone=Qwen3-4B, Optimization Method=GRPO, Sampling Strategy=x322026.01 | 52.9 | — | — | |
| Entropy-RegBackbone=Qwen3-4B, Optimization Method=Entropy-Reg, Sampling Strategy=x322026.01 | 52.4 | — | — | |
| Entropy-AdvBackbone=Qwen3-4B, Optimization Method=Entropy-Adv, Sampling Strategy=x322026.01 | 51.6 | — | — | |
| DIVERBase Model=DeepSeek-R1-Distill-Qwen-7B2025.09 | 51.1 | — | — | |
| GRPOBackbone=Qwen-3-32B, Context length=4K2026.03 | 51 | — | 52 |