Mathematical Reasoning on GSM8k (Accuracy, Loss)
95.22AccuracyQwQ-32B-Preview
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| QwQ-32B-Preview2026.05 | 95.22 | — | |
| Skywork-o12026.05 | 91.28 | — | |
| DeepSeek-r1-Dist.2026.05 | 91.28 | — | |
| RePO_detBackbone=Qwen3-4B-Base2026.06 | 91.05 | — | |
| KTOBackbone=Qwen3-4B-Base2026.06 | 90.83 | — | |
| TDPOBackbone=Qwen3-4B-Base2026.06 | 90.67 | — | |
| RePOBackbone=Qwen3-4B-Base2026.06 | 90.6 | — | |
| RPOBackbone=Qwen3-4B-Base2026.06 | 90.3 | — | |
| REFLECTORAlignment Strategy=GDPO2026.05 | 90.15 | — | |
| Ours (+GDPO)Alignment=GDPO2026.05 | 90.15 | — | |
| IPOBackbone=Qwen3-4B-Base2026.06 | 88.86 | — | |
| REFLECTORAlignment Strategy=SFT2026.05 | 88.2 | — | |
| Ours (+SFT)Alignment=SFT2026.05 | 88.2 | — | |
| DPOBackbone=Qwen3-4B-Base2026.06 | 87.87 | — | |
| STAIR2026.05 | 87.6 | — | |
| Tulu 3 8BDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 87.6 | — | |
| Self-Critique2026.05 | 86.2 | — | |
| Shallow-Align2026.05 | 85.8 | — | |
| OLMo-2-7B-1124-InstructDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 85.2 | — | |
| KTOBackbone=Llama3.1-8B-Instruct2026.06 | 84.61 | — | |
| Original2026.05 | 84.5 | — | |
| RPOBackbone=Llama3.1-8B-Instruct2026.06 | 84.23 | — | |
| DPO2026.05 | 84.15 | — | |
| Qwen-2.5-7B-InstructDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 83.8 | — | |
| Llama-3.1-8B-InstructDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 83.4 | — | |
| TDPOBackbone=Llama3.1-8B-Instruct2026.06 | 82.26 | — | |
| BaseBackbone=Llama3.1-8B-Instruct2026.06 | 81.96 | — | |
| IPOBackbone=Llama3.1-8B-Instruct2026.06 | 80.97 | — | |
| RePO_detBackbone=Qwen3-1.7B-Base2026.06 | 80.74 | — | |
| RePOBackbone=Qwen3-1.7B-Base2026.06 | 80.52 | — | |
| RePO_detBackbone=Llama3.1-8B-Instruct2026.06 | 80.44 | — | |
| Ministral-8B-InstructDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 80 | — | |
| Gemma-2-9B-itDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 79.7 | — | |
| KTOBackbone=Qwen3-1.7B-Base2026.06 | 79.68 | — | |
| IPOBackbone=Qwen3-1.7B-Base2026.06 | 79.45 | — | |
| LLaMA-o12026.05 | 79.38 | — | |
| BaseBackbone=Qwen3-4B-Base2026.06 | 78.77 | — | |
| DPOBackbone=Llama3.1-8B-Instruct2026.06 | 77.63 | — | |
| DPOBackbone=Qwen3-1.7B-Base2026.06 | 77.33 | — | |
| Dr.LLMModel=Qwen2.5, Router=Enabled2025.10 | 75.7 | — | |
| Qwen7BModel=Qwen2.5, Router=None2025.10 | 75.6 | — | |
| Dr.LLMBackbone=LLaMa3-8B, Layers saved=42025.10 | 74.9 | — | |
| Dr.LLMModel=LLaMA-3.1, Router=Enabled2025.10 | 74.9 | — | |
| LLaMA8BModel=LLaMA-3.1, Router=None2025.10 | 73.2 | — | |
| SFT2026.05 | 72.02 | — | |
| OLMo-2-7B-SFTDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 71.2 | — | |
| MAP-Neo-7B-InstructDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 69.4 | — | |
| RPOBackbone=Qwen3-1.7B-Base2026.06 | 69.07 | — | |
| FlexiDepthBackbone=LLaMa3-8B, Layers saved=42025.10 | 65.7 | — | |
| LLaMA3BModel=LLaMA-3.2, Router=None2025.10 | 64.9 | — | |
| Dr.LLMModel=LLaMA-3.2, Router=Enabled2025.10 | 64.3 | — | |
| TDPOBackbone=Qwen3-1.7B-Base2026.06 | 64.06 | — | |
| RePO_detBackbone=Llama3.1-8B-Base2026.06 | 62.17 | — | |
| BaseBackbone=Qwen3-1.7B-Base2026.06 | 61.71 | — | |
| KTOBackbone=Llama3.1-8B-Base2026.06 | 61.56 | — | |
| Adam+NexusOptimizer=Adam+Nexus, Model Size=3B2026.04 | 59 | 1.227 | |
| NexusModel Size=3B, Optimizer=Nexus2026.04 | 59 | 1.227 | |
| ShortGPTBackbone=LLaMa3-8B, Layers saved=42025.10 | 53.6 | — | |
| EvaByte-SFTDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 52.9 | — | |
| OLMoE-1B-7B-0924-InstructDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 47.2 | — | |
| NexusModel scale=3B2026.04 | 47 | 1.533 | |
| MuonOptimizer=Muon, Model Size=3B2026.04 | 46 | 1.236 | |
| IPOBackbone=Llama3.1-8B-Base2026.06 | 45.79 | — | |
| DPOBackbone=Llama3.1-8B-Base2026.06 | 44.5 | — | |
| AdamWOptimizer=AdamW, Model Size=3B2026.04 | 44 | 1.259 | |
| AdamModel scale=3B2026.04 | 44 | 1.519 | |
| AdamWModel Size=3B, Optimizer=AdamW2026.04 | 44 | 1.259 | |
| MindSkipBackbone=LLaMa3-8B, Layers saved=42025.10 | 37.8 | — | |
| RPOBackbone=Llama3.1-8B-Base2026.06 | 28.43 | — | |
| OLMo-v1.7-7B-InstructDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 23.2 | — | |
| TDPOBackbone=Llama3.1-8B-Base2026.06 | 22.44 | — | |
| NexusModel scale=1B2026.04 | 22 | 1.749 | |
| BaseBackbone=Llama3.1-8B-Base2026.06 | 20.02 | — | |
| NexusModel Size=1B, Optimizer=Nexus2026.04 | 20 | 1.396 | |
| AdamModel scale=1B2026.04 | 18 | 1.708 | |
| AdamWModel Size=1B, Optimizer=AdamW2026.04 | 18 | 1.429 | |
| OLMo-7B-InstructDecoding Method=Medusa-style tree-based greedy decoding, Decoding Head=multi-token head2025.11 | 14.3 | — | |
| Dr.LLMModel=Qwen2.5, Router=Enabled2025.10 | 11.5 | — | |
| Qwen3BModel=Qwen2.5, Router=None2025.10 | 11.1 | — | |
| LayerSkipBackbone=LLaMa3-8B, Layers saved=42025.10 | 0.4 | — |