Mathematical Reasoning on GSM8K (Math)
96.4Math ScoreLlama-3.3-70B
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama-3.3-70BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 96.4 | |
| Qwen-3-30B-A3BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 96.3 | |
| Gemma-3-27BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 96 | |
| Mistral-3.2-24BOpenness=Open-weights, Regional Origin=European, Post-training=Instruction-tuned2026.02 | 95.5 | |
| Qwen-3-32BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 95.2 | |
| Gemma-3-12BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 95 | |
| Qwen-3-14BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 95 | |
| OLMo-3.1-32BOpenness=Fully-open, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 94.5 | |
| OLMo-3-7BOpenness=Fully-open, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 93.4 | |
| MiMo-V2 FlashModel Variant=Base, # Shots=8-shot, # Activated Params=15B, # Total Params=309B2026.02 | 92.3 | |
| Kimi-K2Model Variant=Base, # Shots=8-shot, # Activated Params=32B, # Total Params=1043B2026.02 | 92.1 | |
| DeepSeek V3.1Model Variant=Base, # Shots=8-shot, # Activated Params=37B, # Total Params=671B2026.02 | 91.4 | |
| GHS-TDABackbone=Llama 3-8B2026.02 | 91.39 | |
| AoTBackbone=Llama 3-8B2026.02 | 91.2 | |
| GHS-TDABackbone=Qwen 2-14B2026.02 | 91.2 | |
| ToTBackbone=Llama 3-8B2026.02 | 91.1 | |
| DeepSeek V3.2Model Variant=Exp Base, # Shots=8-shot, # Activated Params=37B, # Total Params=671B2026.02 | 91.1 | |
| AoTBackbone=Qwen 2-14B2026.02 | 90.8 | |
| GoTBackbone=Llama 3-8B2026.02 | 90.72 | |
| ToTBackbone=Qwen 2-14B2026.02 | 89.8 | |
| GoTBackbone=Qwen 2-14B2026.02 | 89.1 | |
| Step 3.5 FlashModel Variant=Base, # Shots=8-shot, # Activated Params=11B, # Total Params=196B2026.02 | 88.2 | |
| GLM-4.5Model Variant=Base, # Shots=8-shot, # Activated Params=32B, # Total Params=355B2026.02 | 87.6 | |
| CoTBackbone=Llama 3-8B2026.02 | 87.26 | |
| CoTBackbone=Qwen 2-14B2026.02 | 86.7 | |
| EuroLLM-22BOpenness=Fully-open, Regional Origin=European, Post-training=Instruction-tuned2026.02 | 85.5 | |
| GRPOModel=LLaMA-3.2-3B2025.05 | 85 | |
| Llama-3.1-8BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 84.9 | |
| TPOModel=LLaMA-3.2-3B2025.05 | 82 | |
| TI-DPOModel=LLaMA-3.2-3B2025.05 | 81 | |
| Apertus-70BOpenness=Fully-open, Regional Origin=European, Post-training=Instruction-tuned2026.02 | 80 | |
| KTOModel=LLaMA-3.2-3B2025.05 | 80 | |
| CPOModel=LLaMA-3.2-3B2025.05 | 79.5 | |
| DPOModel=LLaMA-3.2-3B2025.05 | 79 | |
| TDPOModel=LLaMA-3.2-3B2025.05 | 78.5 | |
| SFTModel=LLaMA-3.2-3B2025.05 | 78 | |
| SIMPOModel=LLaMA-3.2-3B2025.05 | 78 | |
| IPOModel=LLaMA-3.2-3B2025.05 | 76 | |
| EuroLLM-9BOpenness=Fully-open, Regional Origin=European, Post-training=Instruction-tuned2026.02 | 74.6 | |
| LLaMA-3-8B-InstructData=ZsRE 10K2026.02 | 73.5 | |
| LocBF-FTData=ZsRE 10K2026.02 | 73 | |
| UltraEditData=ZsRE 10K2026.02 | 73 | |
| DAsource_model=gemma3-27b-it, train_dataset=gsm8k, base_model=Qwen3-1.7B2026.02 | 71.11 | |
| CrispEditData=ZsRE 10K2026.02 | 71 | |
| DAsource_model=qwen3-32b, train_dataset=gsm8k, base_model=Qwen3-1.7B2026.02 | 70.78 | |
| PADsource_model=qwen3-32b, train_dataset=gsm8k, base_model=Qwen3-1.7B2026.02 | 70.36 | |
| PADsource_model=qwen3-8b, train_dataset=gsm8k, base_model=Qwen3-1.7B2026.02 | 69.82 | |
| RSFTsource_model=qwen3-32b, train_dataset=gsm8k, base_model=Qwen3-1.7B2026.02 | 69.7 | |
| PADsource_model=gemma3-27b-it, train_dataset=gsm8k, base_model=Qwen3-1.7B2026.02 | 69.67 | |
| Qwen3-1.7B (Original)2026.02 | 69.14 | |
| DAsource_model=qwen3-8b, train_dataset=gsm8k, base_model=Qwen3-1.7B2026.02 | 68.99 | |
| Apertus-8BOpenness=Fully-open, Regional Origin=European, Post-training=Instruction-tuned2026.02 | 67.7 | |
| RSFTsource_model=qwen3-8b, train_dataset=gsm8k, base_model=Qwen3-1.7B2026.02 | 67.1 | |
| IOAModel=Qwen2.5-14B, Teacher Model=OpenAI o12026.02 | 62.16 | |
| IOAStudent Model=Qwen2.5-7B, Teacher LLM=DeepSeek-R12026.02 | 61.78 | |
| RSFTsource_model=gemma3-27b-it, train_dataset=gsm8k, base_model=Qwen3-1.7B2026.02 | 61.56 | |
| IOAModel=Qwen2.5-7B, Teacher Model=OpenAI o12026.02 | 59.99 | |
| MADAModel=Qwen2.5-14B, Teacher Model=OpenAI o12026.02 | 58.44 | |
| Alignedalpha=12025.06 | 58.3 | |
| Star-AgentsModel=Qwen2.5-14B, Teacher Model=OpenAI o12026.02 | 57.65 | |
| InfLLM v2Training Tokens=100B, Inference Top-K=N/A, Training Top-K=42026.01 | 57.32 | |
| MADAStudent Model=Qwen2.5-7B, Teacher LLM=DeepSeek-R12026.02 | 57.14 | |
| CasCoDModel=Qwen2.5-14B, Teacher Model=OpenAI o12026.02 | 56.86 | |
| PHSATraining Tokens=100B, Inference Top-K=N/A, Training Top-K=22026.01 | 56.63 | |
| PHSATraining Tokens=20B, Inference Top-K=N/A2026.01 | 56.56 | |
| PHSATraining Tokens=100B, Inference Top-K=2, Training Top-K=22026.01 | 56.5 | |
| InfLLM v2Training Tokens=100B, Inference Top-K=4, Training Top-K=42026.01 | 56.5 | |
| PHSATraining Tokens=100B, Inference Top-K=N/A, Training Top-K=42026.01 | 56.25 | |
| MADAModel=Qwen2.5-7B, Teacher Model=OpenAI o12026.02 | 56.24 | |
| CounterDistillModel=Qwen2.5-14B, Teacher Model=OpenAI o12026.02 | 56.24 | |
| Qwen-0.6B-BaseTraining Tokens=N/A, Inference Top-K=N/A2026.01 | 56.18 | |
| PRINMIXalpha=1/162025.06 | 56.1 | |
| DSSModel=Qwen2.5-14B, Teacher Model=OpenAI o12026.02 | 55.97 | |
| PHSATraining Tokens=100B, Inference Top-K=4, Training Top-K=42026.01 | 55.8 | |
| Star-AgentsModel=Qwen2.5-7B, Teacher Model=OpenAI o12026.02 | 55.45 | |
| IOAModel=LLaMA3.1-8B, Teacher Model=OpenAI o12026.02 | 55.07 | |
| DenseTraining Tokens=20B, Inference Top-K=N/A2026.01 | 54.97 | |
| DenseTraining Tokens=100B, Inference Top-K=22026.01 | 54.81 | |
| PHSATraining Tokens=20B, Inference Top-K=22026.01 | 54.81 | |
| LionModel=Qwen2.5-14B, Teacher Model=OpenAI o12026.02 | 54.76 | |
| Warmup-Stable-Only (WSO)Model=8B, αpre=1.0, αmid=1.02026.03 | 54.7 | |
| CasCoDModel=Qwen2.5-7B, Teacher Model=OpenAI o12026.02 | 54.66 | |
| DenseTraining Tokens=20B, Inference Top-K=22026.01 | 54.13 | |
| CounterDistillModel=Qwen2.5-7B, Teacher Model=OpenAI o12026.02 | 54.04 | |
| DSSModel=Qwen2.5-7B, Teacher Model=OpenAI o12026.02 | 53.77 | |
| PRINMIXalpha=1/642025.06 | 52.9 | |
| InfLLM v2Training Tokens=100B, Inference Top-K=2, Training Top-K=22026.01 | 52.84 | |
| LionModel=Qwen2.5-7B, Teacher Model=OpenAI o12026.02 | 52.56 | |
| InfLLM v2Training Tokens=20B, Inference Top-K=N/A2026.01 | 52.54 | |
| DenseTraining Tokens=100B, Inference Top-K=N/A2026.01 | 52.16 | |
| InfLLM v2Training Tokens=100B, Inference Top-K=N/A, Training Top-K=22026.01 | 52.16 | |
| MADAModel=LLaMA3.1-8B, Teacher Model=OpenAI o12026.02 | 51.82 | |
| LaMiniModel=Qwen2.5-14B, Teacher Model=OpenAI o12026.02 | 51.68 | |
| InfLLM v2Training Tokens=20B, Inference Top-K=22026.01 | 51.33 | |
| Star-AgentsModel=LLaMA3.1-8B, Teacher Model=OpenAI o12026.02 | 51.14 | |
| LoRAalpha=1/162025.06 | 50.9 | |
| CasCoDModel=LLaMA3.1-8B, Teacher Model=OpenAI o12026.02 | 50.48 | |
| Self-InstructModel=Qwen2.5-14B, Teacher Model=OpenAI o12026.02 | 50.09 | |
| CounterDistillModel=LLaMA3.1-8B, Teacher Model=OpenAI o12026.02 | 50.06 | |
| DSSModel=LLaMA3.1-8B, Teacher Model=OpenAI o12026.02 | 49.75 |