Mathematical Reasoning on AIME 2025 (Accuracy)
91.67AccuracyHEART
Evaluation Results
| Method | Links | |
|---|---|---|
| HEARTModel=GPT-5 nano2025.09 | 91.67 | |
| HEARTModel=Gemini 2.5 Flash2025.09 | 90.83 | |
| Qwen3-235B-A22B-R-TAPArchitecture=MoE, Parameter Count=235B2026.03 | 88.7 | |
| HEARTModel=Deepseek-Reasoner2025.09 | 88.33 | |
| Gemini2.5-Pro2026.03 | 86.7 | |
| Qwen3-235B-A22BArchitecture=MoE, Parameter Count=235B2026.03 | 81.5 | |
| AM-Thinking-v1-R-TAPArchitecture=Dense, Parameter Count=32B2026.03 | 79.6 | |
| OpenAI-o1 (2024-12-17)2026.03 | 79.2 | |
| Qwen3-32B-R-TAPArchitecture=Dense, Parameter Count=32B2026.03 | 78.2 | |
| OpenAI-o3-mini (Medium)Configuration=Medium2026.03 | 74.8 | |
| AM-Thinking-v1Architecture=Dense, Parameter Count=32B2026.03 | 74.4 | |
| Qwen3-32BArchitecture=Dense, Parameter Count=32B2026.03 | 72.9 | |
| Nemetron-Ultra-253BArchitecture=Dense, Parameter Count=256B2026.03 | 72.5 | |
| DeepSeek-R1Architecture=MoE, Parameter Count=671B2026.03 | 70 | |
| ODA-Math-460kBackbone=Qwen3-8B-Base, Training Dataset Size=460k2025.12 | 63.3 | |
| ODA-Math-460kBackbone=Qwen2.5-7B-Base, Training Dataset Size=460k2025.12 | 56.7 | |
| AM-Thinking (math)Backbone=Qwen3-8B-Base, Training Dataset Size=558k2025.12 | 54.6 | |
| VanillaModel=Gemini 2.5 Flash2025.09 | 52.5 | |
| HEARTModel=Gemma3 12b Instruct2025.09 | 50.83 | |
| AM-Thinking (math)Backbone=Qwen2.5-7B-Base, Training Dataset Size=558k2025.12 | 50 | |
| MiroMind-M1-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=719k2025.12 | 47.5 | |
| SYNTHETIC-2-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=105k2025.12 | 45.8 | |
| OmniThought-0528Backbone=Qwen3-8B-Base, Training Dataset Size=365k2025.12 | 45.4 | |
| OpenThoughts3Backbone=Qwen2.5-7B-Base, Training Dataset Size=1.2M2025.12 | 45 | |
| VanillaModel=Deepseek-Reasoner2025.09 | 40 | |
| OmniThought-0528Backbone=Qwen2.5-7B-Base, Training Dataset Size=365k2025.12 | 40 | |
| CyclicReflexBackbone=Qwen3-14B, Decoding Strategy=CyclicReflex2025.06 | 40 | |
| DIVERBase Model=DeepSeek-R1-Distill-Qwen-7B2025.09 | 36.9 | |
| GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Reward Strategy=Clip-higher2025.09 | 35 | |
| SYNTHETIC-2-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=105k2025.12 | 35 | |
| CyclicReflexBackbone=Qwen3-8B, Decoding Strategy=CyclicReflex2025.06 | 33 | |
| OriginalBackbone=Qwen3-14B, Decoding Strategy=Original2025.06 | 33 | |
| TIPBackbone=Qwen3-14B, Decoding Strategy=TIP2025.06 | 33 | |
| DeepMath-103KBackbone=Qwen2.5-7B-Base, Training Dataset Size=309k2025.12 | 31.7 | |
| Light-R1-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=79k2025.12 | 31.3 | |
| MiroMind-M1-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=719k2025.12 | 30 | |
| OriginalBackbone=Qwen3-8B, Decoding Strategy=Original2025.06 | 27 | |
| Fast-Math-R1-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=8k2025.12 | 26.7 | |
| Light-R1-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=79k2025.12 | 26.7 | |
| Fast-Math-R-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=8k2025.12 | 25.8 | |
| TIPBackbone=Qwen3-8B, Decoding Strategy=TIP2025.06 | 23 | |
| AZR-R-TAPBase Model Type=Base2026.03 | 20.1 | |
| AZR-R-TAPBase Model Type=Coder2026.03 | 18.2 | |
| MegaScience (math)Backbone=Qwen3-8B-Base, Training Dataset Size=414k2025.12 | 17.9 | |
| MegaScience (math)Backbone=Qwen2.5-7B-Base, Training Dataset Size=414k2025.12 | 15 | |
| DIVERBase Model=Qwen2.5-7B-Base2025.09 | 12.9 | |
| GRPOBase Model=Qwen2.5-7B-Base, Reward Strategy=Clip-higher2025.09 | 12.1 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B-Base2025.12 | 10.8 | |
| CyclicReflexBackbone=Qwen3-4B, Decoding Strategy=CyclicReflex2025.06 | 10 | |
| LIMOBackbone=Qwen3-8B-Base, Training Dataset Size=8172025.12 | 8.8 | |
| DIVERBase Model=Qwen2.5-Math-1.5B2025.09 | 8.3 | |
| GRPOBase Model=Qwen2.5-Math-1.5B, Reward Strategy=Clip-higher2025.09 | 7.7 | |
| TIPBackbone=Qwen3-4B, Decoding Strategy=TIP2025.06 | 7 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B-Base2025.12 | 6.7 | |
| OpenMathInstruct-2Backbone=Qwen2.5-7B-Base, Training Dataset Size=1M2025.12 | 5 | |
| OriginalBackbone=Qwen3-4B, Decoding Strategy=Original2025.06 | 3 | |
| LIMOBackbone=Qwen2.5-7B-Base, Training Dataset Size=8172025.12 | 1.7 | |
| DIVERBase Model=LLaMA-3.1-8B-Instruct2025.09 | 1.5 | |
| GRPOBase Model=LLaMA-3.1-8B-Instruct, Reward Strategy=Clip-higher2025.09 | 1.4 |