Math Score on GSM8K
94.01GSM8K Math ScoreQwen3.5-9B + AR-SFT
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.5-9B + AR-SFTModel Size=9B, Training Protocol=AR-SFT, Decoding Strategy=Native AR decoding2026.06 | 94.01 | |
| FLARE-9BModel Size=9B, Training Protocol=FLARE, Decoding Strategy=AR-Trust sampling2026.06 | 93.33 | |
| Qwen3.5-4B + AR-SFTModel Size=4B, Training Protocol=AR-SFT, Decoding Strategy=Native AR decoding2026.06 | 91.66 | |
| FLARE-4BModel Size=4B, Training Protocol=FLARE, Decoding Strategy=AR-Trust sampling2026.06 | 91.05 | |
| (0,2,2)Model=Qwen3, Pruning Ratio=50%2026.06 | 89.2 | |
| Qwen3.5-4B (released)Model Size=4B, Training Protocol=Released, Decoding Strategy=Native AR decoding2026.06 | 89.16 | |
| Qwen3.5-9B (released)Model Size=9B, Training Protocol=Released, Decoding Strategy=Native AR decoding2026.06 | 89.16 | |
| FLARE-2BModel Size=2B, Training Protocol=FLARE, Decoding Strategy=AR-Trust sampling2026.06 | 84.46 | |
| Qwen3.5-2B + AR-SFTModel Size=2B, Training Protocol=AR-SFT, Decoding Strategy=Native AR decoding2026.06 | 83.93 | |
| MANModel=ERNIE, Pruning Ratio=50%2026.06 | 79 | |
| Qwen3.5-2B (released)Model Size=2B, Training Protocol=Released, Decoding Strategy=Native AR decoding2026.06 | 77.63 | |
| DSRMidtraining Schedule=DSR2026.05 | 69.82 | |
| FullModel=OLMoE, Pruning Ratio=0%2026.06 | 68.2 | |
| Unified 15B MoEMidtraining Corpus=1k→8k2026.05 | 66.74 | |
| WSDMidtraining Schedule=WSD2026.05 | 65.59 | |
| Cosine-decayMidtraining Schedule=Cos2026.05 | 62.97 | |
| Unified 15B MoEMidtraining Corpus=4k→8k2026.05 | 61.89 | |
| Unified 15B MoEMidtraining Corpus=4k2026.05 | 61.74 | |
| FullModel=DeepSeek, Pruning Ratio=0%2026.06 | 61 | |
| Unified 15B MoEPretraining Corpus=4k→8k2026.05 | 29.72 | |
| Unified 15B MoEPretraining Corpus=4k2026.05 | 27.56 | |
| Unified 15B MoEPretraining Corpus=1k→8k2026.05 | 26.64 |