Knowledge & Instruction Following on MMLU-Pro
81.39ScoreQwen3.5-9B (released)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.5-9B (released)Model Size=9B, Training Protocol=Released, Decoding Strategy=Native AR decoding2026.06 | 81.39 | |
| Qwen3.5-9BParams=9B, Sampling mode=AR2026.06 | 81.39 | |
| Qwen3.5-4B (released)Model Size=4B, Training Protocol=Released, Decoding Strategy=Native AR decoding2026.06 | 77.88 | |
| Qwen3.5-9B + AR-SFTModel Size=9B, Training Protocol=AR-SFT, Decoding Strategy=Native AR decoding2026.06 | 77.66 | |
| FLARE-9BModel Size=9B, Training Protocol=FLARE, Decoding Strategy=AR-Trust sampling2026.06 | 77.39 | |
| FLARE-9BParams=9B, Sampling mode=AR-Trust2026.06 | 77.39 | |
| LLaDA-2.1-flashParams=100B-A5B, Sampling mode=Diffusion2026.06 | 75.31 | |
| FLARE-9BParams=9B, Sampling mode=Diffusion-Trust2026.06 | 74.73 | |
| LLaDA-2.0-flashParams=100B-A5B, Sampling mode=Diffusion2026.06 | 73.36 | |
| Qwen3.5-4B + AR-SFTModel Size=4B, Training Protocol=AR-SFT, Decoding Strategy=Native AR decoding2026.06 | 71.7 | |
| FLARE-4BModel Size=4B, Training Protocol=FLARE, Decoding Strategy=AR-Trust sampling2026.06 | 71.14 | |
| LLaDA-2.1-miniParams=16B-A1B, Sampling mode=Diffusion2026.06 | 63.42 | |
| LLaDA-2.0-miniParams=16B-A1B, Sampling mode=Diffusion2026.06 | 63.22 | |
| SDAR 30B-A3BParams=30B-A3B, Sampling mode=Diffusion2026.06 | 61.5 | |
| Qwen3.5-2B (released)Model Size=2B, Training Protocol=Released, Decoding Strategy=Native AR decoding2026.06 | 59.53 | |
| Qwen3.5-2B + AR-SFTModel Size=2B, Training Protocol=AR-SFT, Decoding Strategy=Native AR decoding2026.06 | 56.67 | |
| FLARE-2BModel Size=2B, Training Protocol=FLARE, Decoding Strategy=AR-Trust sampling2026.06 | 53.57 |