Mathematical Reasoning on AIME25 (test)
99.4Pass@1GPT-5.4-xhigh
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4-xhighSize=—, # Reas. Tokens=8810.3, Reasoning Paradigm=Reasoning LLMs2026.05 | 99.4 | — | — | — | — | — | — | — | — | — | |
| MiroThinker-v1.5Size=30B, # Reas. Tokens=11295.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 97.2 | — | — | — | — | — | — | — | — | — | |
| GPT-5.4-xhighSize=—, # Reas. Tokens=4821.8, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 94.7 | — | — | — | — | — | — | — | — | — | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=9306.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 93.8 | — | — | — | — | — | — | — | — | — | |
| Tongyi-DeepResearchSize=30B, # Reas. Tokens=7431.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 92 | — | — | — | — | — | — | — | — | — | |
| SR2AM-v1.0-30BSize=30B, # Reas. Tokens=5517.7, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 91.1 | — | — | — | — | — | — | — | — | — | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=3011.5, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 90.7 | — | — | — | — | — | — | — | — | — | |
| K2-Think-V2-highSize=73B, # Reas. Tokens=31905.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 87.6 | — | — | — | — | — | — | — | — | — | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=8269.1, Reasoning Paradigm=Reasoning LLMs2026.05 | 86.9 | — | — | — | — | — | — | — | — | — | |
| Kimi-K2.5Size=1024B, # Reas. Tokens=6413.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 81.6 | — | — | — | — | — | — | — | — | — | |
| WebSailor-32BSize=32B, # Reas. Tokens=1055.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 80.3 | — | — | — | — | — | — | — | — | — | |
| GPT-OSS-120B-highSize=120B, # Reas. Tokens=2700.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 80.2 | — | — | — | — | — | — | — | — | — | |
| ASearcher-Web-QWQ-v2Size=32B, # Reas. Tokens=116752.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 79.3 | — | — | — | — | — | — | — | — | — | |
| SR2AM-v0.1-8BSize=8B, # Reas. Tokens=3697.6, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 74.2 | — | — | — | — | — | — | — | — | — | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=5410.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 66.7 | — | — | — | — | — | — | — | — | — | |
| WebExplorer-8BSize=8B, # Reas. Tokens=3616.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 66.6 | — | — | — | — | — | — | — | — | — | |
| GLM-4.6Size=357B, # Reas. Tokens=3580.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 64.4 | — | — | — | — | — | — | — | — | — | |
| Qwen3-235BSize=235B, # Reas. Tokens=6467.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 63.1 | — | — | — | — | — | — | — | — | — | |
| A2FMSize=32B, # Reas. Tokens=23424.8, Reasoning Paradigm=Mode Routing2026.05 | 62.6 | — | — | — | — | — | — | — | — | — | |
| WebSailor-7BSize=7B, # Reas. Tokens=2211.5, Reasoning Paradigm=Unregulated Deliberation2026.05 | 53 | — | — | — | — | — | — | — | — | — | |
| GRPOModel=Qwen3-4B, Source Dataset=NuminaMath-LEAN2026.06 | 45.1 | 70 | — | — | — | — | 65.9 | 54.9 | 61.8 | 68.4 | |
| GSPOModel=Qwen3-4B, Source Dataset=NuminaMath-LEAN2026.06 | 42.1 | 76.7 | — | — | — | — | 66.7 | 51.9 | 60.6 | 71.3 | |
| DAPOModel=Qwen3-4B, Source Dataset=NuminaMath-LEAN2026.06 | 39.1 | 80 | — | — | — | — | 62 | 47.5 | 55.2 | 69.7 | |
| WAPOModel=Qwen3-4B, Source Dataset=NuminaMath-LEAN2026.06 | 36.4 | 76.7 | — | — | — | — | 63.8 | 45.1 | 54.3 | 71.5 | |
| SimpleTIR-32BSize=32B, # Reas. Tokens=5174.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 32.6 | — | — | — | — | — | — | — | — | — | |
| AFM-Code-7B-RLSize=7B, # Reas. Tokens=11205.5, Reasoning Paradigm=Workflow Distillation2026.05 | 30.1 | — | — | — | — | — | — | — | — | — | |
| Dele-SimKOBackbone=Qwen3-8B2026.01 | 28.4 | 37 | 39.5 | 34.8 | 8,500 | — | — | — | — | — | |
| TGR-LatentBackbone=Qwen3-8B2026.01 | 27.8 | 37.4 | 40.1 | 34.8 | 7,000 | — | — | — | — | — | |
| LCoT-SimKOBackbone=Qwen3-8B2026.01 | 27.5 | 31.5 | 33 | 30.5 | 8,600 | — | — | — | — | — | |
| Dele-GRPOBackbone=Qwen3-8B2026.01 | 27.4 | 35.5 | 37.8 | 33.2 | 8,400 | — | — | — | — | — | |
| DAPOModel=SmolLM3-3B, Source Dataset=NuminaMath-LEAN2026.06 | 27.2 | 56.7 | — | — | — | — | 47.9 | 33.4 | 40.5 | 53.9 | |
| LCoT-GRPOBackbone=Qwen3-8B2026.01 | 26.5 | 27.8 | 28.5 | 27.5 | 8,500 | — | — | — | — | — | |
| GSPOModel=SmolLM3-3B, Source Dataset=NuminaMath-LEAN2026.06 | 26 | 66.7 | — | — | — | — | 50.2 | 32.6 | 40.9 | 59.1 | |
| GRPOModel=SmolLM3-3B, Source Dataset=NuminaMath-LEAN2026.06 | 25.9 | 60 | — | — | — | — | 45.8 | 31.5 | 38.2 | 53 | |
| WAPOModel=SmolLM3-3B, Source Dataset=NuminaMath-LEAN2026.06 | 25.9 | 66.7 | — | — | — | — | 53.5 | 33.5 | 42.9 | 61.7 | |
| TGR-TokenBackbone=Qwen3-8B2026.01 | 25.4 | 33.2 | 35.6 | 31.1 | 7,500 | — | — | — | — | — | |
| PSamplingBackbone=Qwen3-8B2026.01 | 23.8 | 30.1 | 32.1 | 28.4 | 6,000 | — | — | — | — | — | |
| SimpleTIR-7BSize=7B, # Reas. Tokens=3551.7, Reasoning Paradigm=Unregulated Deliberation2026.05 | 21.1 | — | — | — | — | — | — | — | — | — | |
| Base ModelBackbone=Qwen3-8B2026.01 | 18.7 | 26.5 | 28.4 | 24 | 2,600 | — | — | — | — | — | |
| GSPOModel=Gemma3-4B, Source Dataset=NuminaMath-LEAN2026.06 | 14.3 | 30 | — | — | — | — | 24.3 | 17.6 | 21 | 27.4 | |
| DAPOModel=Gemma3-4B, Source Dataset=NuminaMath-LEAN2026.06 | 13.8 | 30 | — | — | — | — | 23.5 | 17.1 | 20.5 | 26.3 | |
| AFM-Web-7B-RLSize=7B, # Reas. Tokens=2608.6, Reasoning Paradigm=Workflow Distillation2026.05 | 13.5 | — | — | — | — | — | — | — | — | — | |
| GRPOModel=Gemma3-4B, Source Dataset=NuminaMath-LEAN2026.06 | 13.5 | 33.3 | — | — | — | — | 24.4 | 16.6 | 20.3 | 28.9 | |
| WAPOModel=Gemma3-4B, Source Dataset=NuminaMath-LEAN2026.06 | 12.4 | 30 | — | — | — | — | 23.4 | 15.9 | 19.6 | 25.5 | |
| ASearcher-Web-7BSize=7B, # Reas. Tokens=601.4, Reasoning Paradigm=Unregulated Deliberation2026.05 | 6.2 | — | — | — | — | — | — | — | — | — | |
| AgentPSOCategory=Multi-Agent2026.05 | — | — | — | — | — | 56.67 | — | — | — | — | |
| CAGradCategory=Multi-objective solvers2026.05 | — | — | — | — | — | 17.4 | — | — | — | — | |
| Chain-of-ThoughtCategory=Vanilla Single-Agent2026.05 | — | — | — | — | — | 40 | — | — | — | — | |
| CHORDCategory=SFT–RL mixing baselines2026.05 | — | — | — | — | — | 17.2 | — | — | — | — | |
| CHORD-ϕShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | — | 8.75 | — | — | — | |
| DAPOModel Category=RL Post-Trained Models2026.05 | — | — | — | — | — | — | 22.2 | — | — | — | |
| DMADCategory=Multi-Agent2026.05 | — | — | — | — | — | 56.67 | — | — | — | — | |
| DPOCategory=RL-free alignment2026.05 | — | — | — | — | — | 15.8 | — | — | — | — | |
| FEST-DPOShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | — | 11.67 | — | — | — | |
| FEST-GRPOShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | — | 14.58 | — | — | — | |
| GAC + Token-φVariant=Token-φ2026.05 | — | — | — | — | — | 19.8 | — | — | — | — | |
| GAC w/o φVariant=w/o φ2026.05 | — | — | — | — | — | 19.1 | — | — | — | — | |
| GradNorm-ctrlCategory=Rule-based controllers2026.05 | — | — | — | — | — | 17.4 | — | — | — | — | |
| GRPOModel Category=RL Post-Trained Models2026.05 | — | — | — | — | — | — | 18.5 | — | — | — | |
| GRPO (pure RL)Category=SFT–RL mixing baselines2026.05 | — | — | — | — | — | 8.54 | — | — | — | — | |
| GSPOModel Category=RL Post-Trained Models2026.05 | — | — | — | — | — | — | 18.5 | — | — | — | |
| HölderPOModel Category=RL Post-Trained Models, Schedule=Linear Des: 2 → −22026.05 | — | — | — | — | — | — | 30 | — | — | — | |
| HPTShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | — | 10.83 | — | — | — | |
| HPTCategory=Recent hybrid SFT–RL2026.05 | — | — | — | — | — | 17.8 | — | — | — | — | |
| HPT-GShot Configuration=128-shot, RL on Gold Dataset (DE)=true2026.05 | — | — | — | — | — | — | 3.33 | — | — | — | |
| IPOCategory=RL-free alignment2026.05 | — | — | — | — | — | 15.5 | — | — | — | — | |
| KL-ctrlCategory=Rule-based controllers2026.05 | — | — | — | — | — | 17.6 | — | — | — | — | |
| LUFFYShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | — | 9.58 | — | — | — | |
| LUFFYCategory=Recent hybrid SFT–RL2026.05 | — | — | — | — | — | 17.6 | — | — | — | — | |
| MADCategory=Multi-Agent2026.05 | — | — | — | — | — | 56.67 | — | — | — | — | |
| MIFOShot Configuration=Full dataset, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | — | 12 | — | — | — | |
| MoACategory=Multi-Agent2026.05 | — | — | — | — | — | 56.67 | — | — | — | — | |
| Nash-MTLCategory=Multi-objective solvers2026.05 | — | — | — | — | — | 17.5 | — | — | — | — | |
| Qwen2.5-7B-Inst.2026.05 | — | — | — | — | — | 6.66 | — | — | — | — | |
| Qwen3-4B-BaseModel Category=Base Model2026.05 | — | — | — | — | — | — | 7.4 | — | — | — | |
| ReflectionCategory=Advanced Single-Agent2026.05 | — | — | — | — | — | 40 | — | — | — | — | |
| ReLIFTShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | — | 11.25 | — | — | — | |
| ReLIFT-GShot Configuration=128-shot, RL on Gold Dataset (DE)=true2026.05 | — | — | — | — | — | — | 9.16 | — | — | — | |
| RLShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | — | 11.67 | — | — | — | |
| RL-GShot Configuration=128-shot, RL on Gold Dataset (DE)=true2026.05 | — | — | — | — | — | — | 14.17 | — | — | — | |
| Self-ConsistencyCategory=Advanced Single-Agent2026.05 | — | — | — | — | — | 60 | — | — | — | — | |
| Self-RefineCategory=Advanced Single-Agent2026.05 | — | — | — | — | — | 53.33 | — | — | — | — | |
| SFT-best2026.05 | — | — | — | — | — | 15.2 | — | — | — | — | |
| SFT-best + RLCategory=SFT–RL mixing baselines2026.05 | — | — | — | — | — | 16.3 | — | — | — | — | |
| SolverBackbone=Qwen3-8B2026.05 | — | — | — | — | — | 31.8 | — | — | — | — | |
| Solver + Verifier (AstraFlow)Backbone=Qwen3-8B, Framework=AstraFlow, Time/iter (s)=77.652026.05 | — | — | — | — | — | 40.6 | — | — | — | — | |
| Solver + Verifier (verl)Backbone=Qwen3-8B, Framework=verl, Time/iter (s)=212.642026.05 | — | — | — | — | — | 41.5 | — | — | — | — | |
| SRFTShot Configuration=Full dataset, RL on Gold Dataset (DE)=false2026.05 | — | — | — | — | — | — | 7.91 | — | — | — | |
| SRFTCategory=Recent hybrid SFT–RL2026.05 | — | — | — | — | — | 17 | — | — | — | — | |
| Step-Back PromptingCategory=Vanilla Single-Agent2026.05 | — | — | — | — | — | 50 | — | — | — | — | |
| ToTCategory=Advanced Single-Agent2026.05 | — | — | — | — | — | 50 | — | — | — | — |