Mathematical Reasoning on GSM8K (Single Metric)
89.92GSM8K AccuracyGemma-3-4B
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemma-3-4BTotal Parameters=4B, Active Parameters=4B, Trained Tokens=4T2025.11 | 89.92 | |
| LFM2-8B-A1BTotal Parameters=8.3B, Active Parameters=1.5B, Trained Tokens=13T2025.11 | 84.38 | |
| DUET-IFBackbone=Llama-3-8b-Instruct2025.02 | 84.2 | |
| Granite-4.0-HTotal Parameters=7B, Active Parameters=1B, Trained Tokens=15T2025.11 | 82.64 | |
| LFM2-2.6BTotal Parameters=2.6B, Active Parameters=2.6B, Trained Tokens=11T2025.11 | 82.41 | |
| SmolLM3-3BTotal Parameters=3.1B, Active Parameters=3.1B, Trained Tokens=11T2025.11 | 81.12 | |
| DUET-LESSBackbone=Llama-3-8b-Instruct2025.02 | 80.5 | |
| ODMBackbone=Llama-3-8b-Instruct2025.02 | 77.3 | |
| IF onlyBackbone=Llama-3-8b-Instruct, M=200002025.02 | 76.9 | |
| AioliBackbone=Llama-3-8b-Instruct2025.02 | 76.5 | |
| Llama-3.2-3BTotal Parameters=3.2B, Active Parameters=3.2B, Trained Tokens=9T2025.11 | 75.21 | |
| Multi-FidBackbone=Llama-3-8b-Instruct2025.02 | 73.9 | |
| Qwen3-4BTotal Parameters=4B, Active Parameters=4B, Trained Tokens=36T2025.11 | 68.46 | |
| Uniform + more training tokensBackbone=Llama-3-8b-Instruct2025.02 | 64.4 | |
| RandomBackbone=Llama-3-8b-Instruct, M=500002025.02 | 64.3 | |
| Gemma-3-1B# Total Params=1B, # Trained Tokens=2T2025.11 | 59.59 | |
| LFM2-1.2B# Total Params=1.2B, # Trained Tokens=11T2025.11 | 58.3 | |
| Qwen3-1.7B# Total Params=1.7B, # Trained Tokens=36T2025.11 | 51.4 | |
| LFM2-700M# Total Params=0.70B, # Trained Tokens=11T2025.11 | 46.4 | |
| Qwen3-0.6B# Total Params=0.6B, # Trained Tokens=36T2025.11 | 36.47 | |
| Llama-3.2-1B# Total Params=1.2B, # Trained Tokens=9T2025.11 | 35.71 | |
| LFM2-350M# Total Params=0.35B, # Trained Tokens=11T2025.11 | 30.1 |