Mathematical Reasoning on OlympiadBench Math
99.86AccuracyHEART
Evaluation Results
| Method | Links | |
|---|---|---|
| HEARTModel=Deepseek-Reasoner2025.09 | 99.86 | |
| HEARTModel=Gemini 2.5 Flash2025.09 | 94.63 | |
| HEARTModel=GPT-5 nano2025.09 | 94.44 | |
| HEARTModel=Gemini 2.5 Pro2025.09 | 93.63 | |
| HEARTModel=Claude 4 Sonnet2025.09 | 92.59 | |
| VanillaModel=GPT-5 nano2025.09 | 83.63 | |
| VanillaModel=Gemini 2.5 Pro2025.09 | 77.67 | |
| AM-Thinking (math)Backbone=Qwen3-8B-Base, Training Dataset Size=558k2025.12 | 77.5 | |
| MiroMind-M1-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=719k2025.12 | 77 | |
| VanillaModel=Gemini 2.5 Flash2025.09 | 76.93 | |
| ODA-Math-460kBackbone=Qwen3-8B-Base, Training Dataset Size=460k2025.12 | 76.3 | |
| VanillaModel=Claude 4 Sonnet2025.09 | 75.44 | |
| OmniThought-0528Backbone=Qwen3-8B-Base, Training Dataset Size=365k2025.12 | 74.9 | |
| VanillaModel=Deepseek-Reasoner2025.09 | 74.41 | |
| AM-Thinking (math)Backbone=Qwen2.5-7B-Base, Training Dataset Size=558k2025.12 | 74.2 | |
| HEARTModel=Gemma3 12b Instruct2025.09 | 72.78 | |
| SYNTHETIC-2-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=105k2025.12 | 71.5 | |
| ODA-Math-460kBackbone=Qwen2.5-7B-Base, Training Dataset Size=460k2025.12 | 70.9 | |
| Light-R1-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=79k2025.12 | 69.7 | |
| OpenThoughts3Backbone=Qwen2.5-7B-Base, Training Dataset Size=1.2M2025.12 | 68.8 | |
| OmniThought-0528Backbone=Qwen2.5-7B-Base, Training Dataset Size=365k2025.12 | 68.1 | |
| SYNTHETIC-2-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=105k2025.12 | 67.4 | |
| MiroMind-M1-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=719k2025.12 | 66.3 | |
| Fast-Math-R-SFTBackbone=Qwen3-8B-Base, Training Dataset Size=8k2025.12 | 61 | |
| DeepMath-103KBackbone=Qwen2.5-7B-Base, Training Dataset Size=309k2025.12 | 60.2 | |
| Light-R1-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=79k2025.12 | 60.2 | |
| HEARTModel=Gemma3 4b Instruct2025.09 | 58.63 | |
| MegaScience (math)Backbone=Qwen3-8B-Base, Training Dataset Size=414k2025.12 | 57.6 | |
| VanillaModel=Gemma3 12b Instruct2025.09 | 52.33 | |
| Fast-Math-R1-SFTBackbone=Qwen2.5-7B-Base, Training Dataset Size=8k2025.12 | 50.3 | |
| INFUSERAnchor Model=Qwen3-8B-Base2026.06 | 50.24 | |
| AZRAnchor Model=Qwen3-8B-Base2026.06 | 47.92 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B-Base2025.12 | 47.2 | |
| PivotTraceBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 47 | |
| CoEBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 46.8 | |
| RandomBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 46.7 | |
| R-Few†Anchor Model=Qwen3-8B-Base2026.06 | 46.4 | |
| EntropyBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 46.3 | |
| Self-CertaintyBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 45.8 | |
| CoT-KineticsBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 45.7 | |
| ConsistencyBackbone=Deepseek-R1-Distill-Qwen-1.5B, Multiple stochastic inferences=true2026.06 | 45.2 | |
| R-ZeroAnchor Model=Qwen3-8B-Base2026.06 | 45.1 | |
| MegaScience (math)Backbone=Qwen2.5-7B-Base, Training Dataset Size=414k2025.12 | 44.5 | |
| SPICE†Anchor Model=Qwen3-8B-Base2026.06 | 42.5 | |
| VanillaModel=Gemma3 4b Instruct2025.09 | 40.7 | |
| BaseAnchor Model=Qwen3-8B-Base2026.06 | 40.36 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B-Base2025.12 | 35.9 | |
| LIMOBackbone=Qwen2.5-7B-Base, Training Dataset Size=8172025.12 | 34.9 | |
| LIMOBackbone=Qwen3-8B-Base, Training Dataset Size=8172025.12 | 31.3 | |
| OpenMathInstruct-2Backbone=Qwen2.5-7B-Base, Training Dataset Size=1M2025.12 | 30.7 | |
| MathFusion-DSMath-7BBase Model=DeepSeekMath-7B, # Samples=195K2025.03 | 25.5 | |
| MathFusion-DSMath-7BBase Model=DeepSeekMath-7B, # Samples=60K2025.03 | 23.3 | |
| DeepSeekMath-7B-DART-MathBase Model=DeepSeekMath-7B, # Samples=590K2025.03 | 21.7 | |
| DART-Math-DSMath-7BTraining Method=SFT, Data Selection Strategy=Prop2Diff, Backbone=DeepSeekMath-7B2024.06 | 21.7 | |
| MathFusion-DSMath-7BBase Model=DeepSeekMath-7B, # Samples=30K, Training Strategy=Sequential2025.03 | 21.6 | |
| DART-Math-DSMath-7BTraining Method=SFT, Data Selection Strategy=Uniform, Backbone=DeepSeekMath-7B2024.06 | 21.3 | |
| DeepSeekMath-7B-DART-Math†Base Model=DeepSeekMath-7B, # Samples=60K2025.03 | 21 | |
| MathFusion-DSMath-7BBase Model=DeepSeekMath-7B, # Samples=30K, Training Strategy=Conditional2025.03 | 19.3 | |
| DeepSeekMath-7B-RFTBase Model=DeepSeekMath-7B, # Samples=590K2025.03 | 19.1 | |
| MathFusion-DSMath-7BBase Model=DeepSeekMath-7B, # Samples=30K, Training Strategy=Parallel2025.03 | 19 | |
| DeepSeekMath-7B-RLTraining Method=RL, Backbone=DeepSeekMath-7B2024.06 | 18.7 | |
| MathFusion-Llama3-8BBase Model=Llama3-8B, # Samples=60K2025.03 | 17.2 | |
| Mistral-7B-DART-MathBase Model=Mistral-7B, # Samples=590K2025.03 | 14.7 | |
| Llama3-8B-DART-MathBase Model=Llama3-8B, # Samples=590K2025.03 | 14.5 | |
| DeepSeekMath-7B-InstructBase Model=DeepSeekMath-7B, # Samples=780K2025.03 | 14.2 | |
| MathFusion-Mistral-7BBase Model=Mistral-7B, # Samples=60K2025.03 | 13.6 | |
| DeepSeekMath-7B-MMIQCBase Model=DeepSeekMath-7B, # Samples=2.3M2025.03 | 13 | |
| Llama3-8B-DART-Math†Base Model=Llama3-8B, # Samples=60K2025.03 | 12.9 | |
| MathFusion-Llama3-8BBase Model=Llama3-8B, # Samples=30K, Training Strategy=Sequential2025.03 | 12.6 | |
| MathFusion-Llama3-8BBase Model=Llama3-8B, # Samples=30K, Training Strategy=Parallel2025.03 | 11.9 | |
| MathFusion-Llama3-8BBase Model=Llama3-8B, # Samples=30K, Training Strategy=Conditional2025.03 | 11.9 | |
| MathFusion-Mistral-7BBase Model=Mistral-7B, # Samples=30K, Training Strategy=Parallel2025.03 | 11 | |
| DeepSeekMath-7B-RefAugBase Model=DeepSeekMath-7B, # Samples=60K2025.03 | 10.5 | |
| DeepSeekMath-7B-MMIQC†Base Model=DeepSeekMath-7B, # Samples=60K2025.03 | 10.4 | |
| DeepSeekMath-7B-RefAugBase Model=DeepSeekMath-7B, # Samples=30K2025.03 | 10.1 | |
| Llama3-8B-MMIQCBase Model=Llama3-8B, # Samples=2.3M2025.03 | 9.6 | |
| DeepSeekMath-7B-MetaMathBase Model=DeepSeekMath-7B, # Samples=60K2025.03 | 9.5 | |
| Mistral-7B-MMIQCBase Model=Mistral-7B, # Samples=2.3M2025.03 | 9.4 | |
| MathFusion-Mistral-7BBase Model=Mistral-7B, # Samples=30K, Training Strategy=Sequential2025.03 | 9.3 | |
| Llama3-8B-RFTBase Model=Llama3-8B, # Samples=590K2025.03 | 9.3 | |
| Mistral-7B-RFTBase Model=Mistral-7B, # Samples=590K2025.03 | 8.7 | |
| Mistral-7B-DART-Math†Base Model=Mistral-7B, # Samples=60K2025.03 | 8.7 | |
| Mistral-7B-WizardMath-V1.1Base Model=Mistral-7B, # Samples=418K2025.03 | 7.7 | |
| MathFusion-Mistral-7BBase Model=Mistral-7B, # Samples=30K, Training Strategy=Conditional2025.03 | 7.3 | |
| Mistral-7B-MetaMathBase Model=Mistral-7B, # Samples=400K2025.03 | 5.9 | |
| DeepSeekMath-7B-StandardBase Model=DeepSeekMath-7B, # Samples=15K2025.03 | 5.6 | |
| Llama3-8B-MetaMathBase Model=Llama3-8B, # Samples=400K2025.03 | 5.5 | |
| Llama3-8B-RefAugBase Model=Llama3-8B, # Samples=60K2025.03 | 5.5 | |
| Llama3-8B-MetaMath†Base Model=Llama3-8B, # Samples=60K2025.03 | 5.3 | |
| Llama3-8B-MMIQC†Base Model=Llama3-8B, # Samples=60K2025.03 | 5.2 | |
| Mistral-7B-MetaMath†Base Model=Mistral-7B, # Samples=60K2025.03 | 5 | |
| Mistral-7B-MMIQC†Base Model=Mistral-7B, # Samples=60K2025.03 | 5 | |
| Llama3-8B-StandardBase Model=Llama3-8B, # Samples=15K2025.03 | 4.7 | |
| Llama3-8B-RefAugBase Model=Llama3-8B, # Samples=30K2025.03 | 4.7 | |
| Mistral-7B-RefAugBase Model=Mistral-7B, # Samples=60K2025.03 | 3.9 | |
| Mistral-7B-RefAugBase Model=Mistral-7B, # Samples=30K2025.03 | 3.1 | |
| Mistral-7B-StandardBase Model=Mistral-7B, # Samples=15K2025.03 | 2.2 |