Grade School Math Word Problems on GSM8K
0.971AccuracyQwen-3.5 27B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen-3.5 27BConfig=Hybrid MoE, @32k speedup=0.5×2026.04 | 0.971 | |
| TDA-RCBase LLM=DeepSeek-V32026.03 | 0.944 | |
| TDA-RCBase LLM=GPT-4o-mini2026.03 | 0.942 | |
| TDA-RCBase LLM=Qwen-Turbo2026.03 | 0.937 | |
| Instruction InductionBase LLM=DeepSeek-V32026.03 | 0.934 | |
| MIXSDModel backbone=Qwen3-8B, Fine-tuning method=MIXSD, Mixing rate λ=0.52026.05 | 0.933 | |
| MIXSDModel backbone=Qwen3-4B-It, Fine-tuning method=MIXSD, Mixing rate λ=0.52026.05 | 0.932 | |
| MIXSDModel backbone=Qwen3-4B-It, Fine-tuning method=MIXSD, Mixing rate λ=0.72026.05 | 0.93 | |
| Instruction InductionBase LLM=GPT-4o-mini2026.03 | 0.929 | |
| Role / Persona PromptingBase LLM=DeepSeek-V32026.03 | 0.928 | |
| BaseModel backbone=Qwen3-4B-It, Fine-tuning method=Base2026.05 | 0.926 | |
| MIXSDModel backbone=Qwen3-8B, Fine-tuning method=MIXSD, Mixing rate λ=0.72026.05 | 0.926 | |
| Instruction InductionBase LLM=Qwen-Turbo2026.03 | 0.925 | |
| Role / Persona PromptingBase LLM=GPT-4o-mini2026.03 | 0.924 | |
| Prompt CanvasBase LLM=DeepSeek-V32026.03 | 0.924 | |
| Prompt CanvasBase LLM=GPT-4o-mini2026.03 | 0.921 | |
| Role / Persona PromptingBase LLM=Qwen-Turbo2026.03 | 0.92 | |
| HoTBase LLM=DeepSeek-V32026.03 | 0.92 | |
| MIXSDModel backbone=Qwen3-8B, Fine-tuning method=MIXSD, Mixing rate λ=0.32026.05 | 0.919 | |
| BaseModel backbone=Qwen3-8B, Fine-tuning method=Base2026.05 | 0.918 | |
| MIXSDModel backbone=Qwen3-8B, Fine-tuning method=MIXSD, Mixing rate λ=02026.05 | 0.918 | |
| Prompt CanvasBase LLM=Qwen-Turbo2026.03 | 0.917 | |
| MIXSDModel backbone=Qwen3-4B-It, Fine-tuning method=MIXSD, Mixing rate λ=0.32026.05 | 0.917 | |
| HoTBase LLM=GPT-4o-mini2026.03 | 0.916 | |
| MIXSDModel backbone=Qwen3-4B-It, Fine-tuning method=MIXSD, Mixing rate λ=02026.05 | 0.915 | |
| HoTBase LLM=Qwen-Turbo2026.03 | 0.914 | |
| OPSDModel backbone=Qwen3-8B, Fine-tuning method=OPSD2026.05 | 0.882 | |
| Analogical PromptingBase LLM=DeepSeek-V32026.03 | 0.876 | |
| Analogical PromptingBase LLM=GPT-4o-mini2026.03 | 0.872 | |
| Analogical PromptingBase LLM=Qwen-Turbo2026.03 | 0.87 | |
| OPSDModel backbone=Qwen3-4B-It, Fine-tuning method=OPSD2026.05 | 0.839 | |
| Qwen3-4B2026.02 | 0.8362 | |
| PretrainRLBackbone=Qwen3-4B2026.02 | 0.8097 | |
| BaseModel backbone=Qwen3-1.7B, Fine-tuning method=Base2026.05 | 0.804 | |
| CoDDDecoding Strategy=Entropy, Diffusion Steps=2562026.02 | 0.7475 | |
| Mixtral 8x7BActive Params=13B2024.01 | 0.744 | |
| DreamDecoding Strategy=Entropy, Diffusion Steps=2562026.02 | 0.7134 | |
| DreamDecoding Strategy=Margin, Diffusion Steps=2562026.02 | 0.7043 | |
| LLaMA 2 70BActive Params=70B2024.01 | 0.696 | |
| CoDDDecoding Strategy=Entropy, Diffusion Steps=1282026.02 | 0.6702 | |
| MIXSDModel backbone=Qwen3-1.7B, Fine-tuning method=MIXSD, Mixing rate λ=0.52026.05 | 0.656 | |
| MIXSDModel backbone=Qwen3-1.7B, Fine-tuning method=MIXSD, Mixing rate λ=0.72026.05 | 0.622 | |
| MIXSDModel backbone=Qwen3-1.7B, Fine-tuning method=MIXSD, Mixing rate λ=0.32026.05 | 0.607 | |
| CoDDDecoding Strategy=Entropy, Diffusion Steps=642026.02 | 0.5641 | |
| DreamDecoding Strategy=Entropy, Diffusion Steps=1282026.02 | 0.5618 | |
| DreamDecoding Strategy=Margin, Diffusion Steps=1282026.02 | 0.561 | |
| GIFTBackbone Model=Dream-v0-7B-Base, Training Dataset=Tulu3-10k, Fine-tuning Protocol=Full-parameter Tuning, Evaluation Protocol=0-shot2025.09 | 0.552 | |
| SFTBackbone Model=Dream-v0-7B-Base, Training Dataset=Tulu3-10k, Fine-tuning Protocol=Full-parameter Tuning, Evaluation Protocol=0-shot2025.09 | 0.503 | |
| Mistral 7BActive Params=7B2024.01 | 0.5 | |
| YOCO (CLSA)Model Scale=4B, Attention=Cross-Layer Sparse2026.06 | 0.47 | |
| DreamDecoding Strategy=Low Confidence, Diffusion Steps=1282026.02 | 0.4685 | |
| Base + SFTBackbone Model=OLMoE-1B-7B-0125, Compression Ratio (p)=0%, Supervised Fine-Tuning (SFT)=true2026.06 | 0.451 | |
| LLaMA 1 33BActive Params=33B2024.01 | 0.441 | |
| Fisher-IntDim-G + SFTBackbone Model=OLMoE-1B-7B-0125, Compression Ratio (p)=50%, Supervised Fine-Tuning (SFT)=true2026.06 | 0.438 | |
| TransformerModel Scale=4B2026.06 | 0.434 | |
| YOCO (Dense)Model Scale=4B2026.06 | 0.43 | |
| DreamDecoding Strategy=Low Confidence, Diffusion Steps=642026.02 | 0.4011 | |
| DreamDecoding Strategy=Random, Diffusion Steps=1282026.02 | 0.395 | |
| Expert-level Fisher + SFTBackbone Model=OLMoE-1B-7B-0125, Compression Ratio (p)=50%, Supervised Fine-Tuning (SFT)=true2026.06 | 0.391 | |
| DreamDecoding Strategy=Random, Diffusion Steps=2562026.02 | 0.3836 | |
| DreamDecoding Strategy=Low Confidence, Diffusion Steps=2562026.02 | 0.3836 | |
| MoE comp. (Fisher) + SFTBackbone Model=OLMoE-1B-7B-0125, Compression Ratio (p)=50%, Supervised Fine-Tuning (SFT)=true2026.06 | 0.371 | |
| DreamDecoding Strategy=Random, Diffusion Steps=642026.02 | 0.3601 | |
| DreamDecoding Strategy=Margin, Diffusion Steps=642026.02 | 0.357 | |
| LLaMA 2 13BActive Params=13B2024.01 | 0.343 | |
| DreamDecoding Strategy=Entropy, Diffusion Steps=642026.02 | 0.3397 | |
| MoE comp. (activation) + SFTBackbone Model=OLMoE-1B-7B-0125, Compression Ratio (p)=50%, Supervised Fine-Tuning (SFT)=true2026.06 | 0.318 | |
| MoE comp. + SFTBackbone Model=OLMoE-1B-7B-0125, Compression Ratio (p)=50%, Supervised Fine-Tuning (SFT)=true2026.06 | 0.306 | |
| SFTModel backbone=Qwen3-8B, Fine-tuning method=SFT2026.05 | 0.293 | |
| SFTModel backbone=Qwen3-4B-It, Fine-tuning method=SFT2026.05 | 0.234 | |
| LLaMA 2 7BActive Params=7B2024.01 | 0.16 | |
| MoE-Pruner + SFTBackbone Model=OLMoE-1B-7B-0125, Compression Ratio (p)=50%, Supervised Fine-Tuning (SFT)=true2026.06 | 0.152 | |
| SFTModel backbone=Qwen3-1.7B, Fine-tuning method=SFT2026.05 | 0.098 | |
| MIXSDModel backbone=Qwen3-1.7B, Fine-tuning method=MIXSD, Mixing rate λ=02026.05 | 0.058 | |
| OPSDModel backbone=Qwen3-1.7B, Fine-tuning method=OPSD2026.05 | 0.034 | |
| SFTBackbone=Qwen3-4B2026.02 | 0.0053 |