Mathematical Reasoning on GSM8K v1.1 (test)
81.7AccuracyExpertCondenser
Evaluation Results
| Method | Links | |
|---|---|---|
| ExpertCondenserModel=GPT-OSS, Model Size=20B, Post-train Type=ExpertCondenser, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 81.7 | |
| DenseMixerModel=GPT-OSS, Model Size=20B, Post-train Type=DenseMixer, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 80.1 | |
| SFTModel=GPT-OSS, Model Size=20B, Post-train Type=SFT, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 78.2 | |
| ESFTModel=GPT-OSS, Model Size=20B, Post-train Type=ESFT, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 76.6 | |
| ExpertCondenserModel=OLMoE, Model Size=7B, Post-train Type=ExpertCondenser, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 68.4 | |
| ExpertCondenserModel=OLMoE, Model Size=7B, Post-train Type=ExpertCondenser, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 67.8 | |
| DenseMixerModel=OLMoE, Model Size=7B, Post-train Type=DenseMixer, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 66.2 | |
| SFTModel=OLMoE, Model Size=7B, Post-train Type=SFT, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 65.3 | |
| DenseMixerModel=OLMoE, Model Size=7B, Post-train Type=DenseMixer, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 64.6 | |
| ESFTModel=OLMoE, Model Size=7B, Post-train Type=ESFT, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 64.4 | |
| SFTModel=OLMoE, Model Size=7B, Post-train Type=SFT, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 63.6 | |
| ExpertCondenserModel=DeepSeek-V2-Lite, Model Size=16B, Post-train Type=ExpertCondenser, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 63.6 | |
| ESFTModel=OLMoE, Model Size=7B, Post-train Type=ESFT, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 62.2 | |
| DenseMixerModel=DeepSeek-V2-Lite, Model Size=16B, Post-train Type=DenseMixer, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 61.6 | |
| ExpertCondenserModel=DeepSeek-V2-Lite, Model Size=16B, Post-train Type=ExpertCondenser, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 59.4 | |
| ExpertCondenserModel=Qwen1.5-MoE, Model Size=14B, Post-train Type=ExpertCondenser, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 58.8 | |
| ESFTModel=DeepSeek-V2-Lite, Model Size=16B, Post-train Type=ESFT, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 58.6 | |
| SFTModel=DeepSeek-V2-Lite, Model Size=16B, Post-train Type=SFT, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 58.4 | |
| ESFTModel=DeepSeek-V2-Lite, Model Size=16B, Post-train Type=ESFT, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 58.2 | |
| DenseMixerModel=DeepSeek-V2-Lite, Model Size=16B, Post-train Type=DenseMixer, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 57.6 | |
| SFTModel=DeepSeek-V2-Lite, Model Size=16B, Post-train Type=SFT, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 57.6 | |
| ExpertCondenserModel=Qwen1.5-MoE, Model Size=14B, Post-train Type=ExpertCondenser, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 57.2 | |
| DenseMixerModel=Qwen1.5-MoE, Model Size=14B, Post-train Type=DenseMixer, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 55.8 | |
| DenseMixerModel=Qwen1.5-MoE, Model Size=14B, Post-train Type=DenseMixer, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 54.6 | |
| ESFTModel=Qwen1.5-MoE, Model Size=14B, Post-train Type=ESFT, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 52.5 | |
| SFTModel=Qwen1.5-MoE, Model Size=14B, Post-train Type=SFT, Post-training Dataset=math14k, Evaluation Protocol=zero-shot2026.04 | 51.8 | |
| ESFTModel=Qwen1.5-MoE, Model Size=14B, Post-train Type=ESFT, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 46.9 | |
| SFTModel=Qwen1.5-MoE, Model Size=14B, Post-train Type=SFT, Post-training Dataset=math7k, Evaluation Protocol=zero-shot2026.04 | 45.8 |