Instruction Following on IFEval
95IFEval AccuracyQwen3.5-27B
Evaluation Results
| Method | Links | |||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5-27BArchitecture=Dense, # Total Params=27B, # Activated Params=27B, Reasoning Mode=REASONING2026.04 | 95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| S-PSRLL+promptBackbone=Gemma-2-9b-it, Evaluation Protocol=Activation Steering + Prompting2026.05 | 93.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 94.6 | — | — | — | |
| GPT-5 miniReasoning Mode=REASONING: HIGH2026.04 | 92.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| A-PSRMSE+promptBackbone=Gemma-2-9b-it, Evaluation Protocol=Activation Steering + Prompting2026.05 | 92.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 93.5 | — | — | — | |
| S-ConstLL+promptBackbone=Gemma-2-9b-it, Evaluation Protocol=Activation Steering + Prompting2026.05 | 91.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 94.3 | — | — | — | |
| Qwen3-30B-A3BGroup=Larger, Configuration=Optimal serving and decoding2026.03 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gpt-oss-20b-highGroup=Larger, Configuration=Optimal serving and decoding2026.03 | 91.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| S-PSRMSE+promptBackbone=Gemma-2-9b-it, Evaluation Protocol=Activation Steering + Prompting2026.05 | 91.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 94 | — | — | — | |
| RL w/ PaTaRMBase Model=Qwen3-14B2025.10 | 90.9 | — | — | — | 87.8 | 90.2 | 92.1 | 93.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-14BGroup=Larger, Configuration=Optimal serving and decoding2026.03 | 90.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RDPO2026.05 | 90.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BF16Model=Nemotron Nano V22026.01 | 90.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVFP4 PTQModel=Nemotron Nano V22026.01 | 89.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RL w/ SkyworkBase Model=Qwen3-14B2025.10 | 89.8 | — | — | — | 86.5 | 89.1 | 91 | 92.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| S-PSRLL+promptBackbone=Phi-3-mini-instruct, Evaluation Protocol=Activation Steering + Prompting2026.05 | 89.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.2 | — | — | — | |
| K-EXAONE-236B-A23BArchitecture=MoE, # Total Params=236B, # Activated Params=23B, Reasoning Mode=REASONING2026.04 | 89.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EXAONE 4.5 33BArchitecture=Dense, # Total Params=33B, # Activated Params=32B, Reasoning Mode=REASONING2026.04 | 89.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPO2026.05 | 89.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPO (RLCF)Base Model=Qwen3-14B2025.10 | 89.4 | — | — | — | 85.8 | 88.7 | 90.6 | 92.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVFP4 QADModel=Nemotron Nano V22026.01 | 89.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| A-ConstLL+promptBackbone=Phi-3-mini-instruct, Evaluation Protocol=Activation Steering + Prompting2026.05 | 89.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 75.2 | — | — | — | |
| WMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=Extended, Top-k Layers=8, Coeff=-0.25, Reposition=false2025.12 | 89.28 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-14BModel=Qwen3-14B2025.10 | 89 | — | — | — | 85.8 | 88.2 | 90.3 | 91.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=Extended, Top-k Layers=4, Coeff=-1, Reposition=false2025.12 | 88.72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Stolfo et al. (2025)+promptBackbone=Gemma-2-9b-it, Evaluation Protocol=Activation Steering + Prompting, Variant=b2026.05 | 88.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 94.6 | — | — | — | |
| Qwen3-Next-80B-A3B-ThinkingN. Params=80B, MoE=true, Reasoning=true2025.12 | 88.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=China-centric, Top-k Layers=8, Coeff=-0.25, Reposition=false2025.12 | 88.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WRMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=Extended, Top-k Layers=16, Coeff=-0.15, Reposition=false2025.12 | 88.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=China-centric, Top-k Layers=4, Coeff=-0.5, Reposition=false2025.12 | 88.35 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-235B-A22BArchitecture=MoE, # Total Params=236B, # Activated Params=22B, Reasoning Mode=Thinking2026.04 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DictaLM 3.0 24B-ThinkParameters=24B, Variant=Thinking2026.02 | 88.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPARDBackbone=Qwen3-8B2026.04 | 88.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WRMDBase Model=Qwen3-Next-4B-Thinking, N. Params=4B, MoE=false, Reasoning=true, Train Dataset=Extended, Top-k Layers=2, Coeff=-2, Reposition=false2025.12 | 87.99 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVFP4 QADModel=Llama Nemotron Super V12026.01 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GOLFBackbone=Qwen-3-8B2026.03 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama 3.1 InstructModel Scale=70B2025.04 | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| A-PSRLL+promptBackbone=Gemma-2-9b-it, Evaluation Protocol=Activation Steering + Prompting2026.05 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80 | — | — | — | |
| BF16Model=Llama Nemotron Super V12026.01 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=Extended, Top-k Layers=4, Coeff=-2, Reposition=false2025.12 | 87.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVFP4 QATModel=Llama Nemotron Super V12026.01 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFTBase Model=Qwen3-14B2025.10 | 87.1 | — | — | — | 83.5 | 85.6 | 89 | 90.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| A-ConstLL+promptBackbone=Gemma-2-2b-it, Evaluation Protocol=Activation Steering + Prompting2026.05 | 87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | — | — | — | |
| NVFP4 PTQModel=Llama Nemotron Super V12026.01 | 86.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SDModel=Llama-3.1 8B/70B-Instruct, L=102026.02 | 86.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 0.87 | 5.47 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Stolfo et al. (2025)+promptBackbone=Gemma-2-9b-it, Evaluation Protocol=Activation Steering + Prompting, Variant=a2026.05 | 86.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama 70B2026.02 | 86.57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GOLFBackbone=Qwen-3-4B2026.03 | 86.51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| A-PSRLL+promptBackbone=Gemma-2-2b-it, Evaluation Protocol=Activation Steering + Prompting2026.05 | 86.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 84.6 | — | — | — | |
| Llama3.1-70BPrecision=BF162026.02 | 86.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaseBackbone=Qwen3-8B2026.04 | 86.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| + GRPOrmBackbone=Qwen3-8B2026.04 | 86.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| + GRPOavgBackbone=Qwen3-8B2026.04 | 86.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVFP4 QATModel=Nemotron Nano V22026.01 | 86.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SD + DMModel=Llama-3.1 8B/70B-Instruct, L=102026.02 | 86.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 0.99 | 6.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WRMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=China-centric, Top-k Layers=8, Coeff=-0.25, Reposition=false2025.12 | 86.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RL initialization model2026.05 | 86.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TI-DPOBackbone=LLaMA-3.1-8B2025.05 | 86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| + GRPOimpBackbone=Qwen3-8B2026.04 | 85.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-14BRole=Teacher2026.02 | 85.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Next-4B-ThinkingN. Params=4B, MoE=false, Reasoning=true2025.12 | 85.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| promptBackbone=Gemma-2-9b-it, Evaluation Protocol=Prompting Only2026.05 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 94.8 | — | — | — | |
| Qwen3-4BTotal Parameters=4B, Active Parameters=4B, Trained Tokens=36T2025.11 | 85.62 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SDModel=Llama-3.1 8B/70B-Instruct, L=52026.02 | 85.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1 | 4.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Critique-GRPOBackbone=Qwen-3-8B2026.03 | 85.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| S-PSRLL+promptBackbone=Mistral-7B-Instruct, Evaluation Protocol=Activation Steering + Prompting2026.05 | 85.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 75.5 | — | — | — | |
| OriginalModel=Qwen3-32B, MLP Sparsity=0%2026.06 | 85.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemma 3 27BParameters=27B2026.02 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLM-4.7-Flash-T#Token=19002026.04 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| + DPOBackbone=Qwen3-8B2026.04 | 85.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama3.1-70BPrecision=FP4 w. Attn-QAT2026.02 | 85.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8BInference Mode=think2026.03 | 85.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SD + DMModel=Llama-3.1 8B/70B-Instruct, L=52026.02 | 85.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1.1 | 4.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RMDBase Model=Qwen3-Next-80B-A3B-Thinking, N. Params=80B, MoE=true, Reasoning=true, Train Dataset=China-centric, Top-k Layers=4, Coeff=-0.75, Reposition=false2025.12 | 85.21 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Critique-GRPOBackbone=Qwen-3-4B2026.03 | 85.21 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| A-PSRMSE+promptBackbone=Phi-3-mini-instruct, Evaluation Protocol=Activation Steering + Prompting2026.05 | 85.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.6 | — | — | — | |
| A-ConstLL+promptBackbone=Gemma-2-9b-it, Evaluation Protocol=Activation Steering + Prompting2026.05 | 85.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 92 | — | — | — | |
| TPOBackbone=LLaMA-3.1-8B2025.05 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPOBackbone=LLaMA-3.1-8B2025.05 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemma 2 27B2026.02 | 84.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPOBackbone=Qwen-3-8B2026.03 | 84.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| + SFTBackbone=Qwen3-8B2026.04 | 84.73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Next-80B-A3B#Token=6002026.04 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| I-DLMParams=8B, Decoding=ISD (N=4, sampling)2026.04 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3Params=8B2026.04 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| I-DLMParams=32B, Decoding=ISD (N=4, sampling)2026.04 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3Parameters=8B, Architecture=AR2026.04 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| I-DLMParameters=8B2026.04 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3Params=32B2026.04 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPOBackbone=Qwen-3-4B2026.03 | 84.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Critique-FTBackbone=Qwen-3-8B2026.03 | 84.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Refinement-FTBackbone=Qwen-3-8B2026.03 | 84.29 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OLMo-3.1-32BOpenness=Fully-open, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8BInference Mode=no-think2026.03 | 84.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mi:dm 2.0 Base-instType=Instruction-tuned2026.01 | 84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CPOBackbone=LLaMA-3.1-8B2025.05 | 84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Next-4B-InstructN. Params=4B, MoE=false, Reasoning=false2025.12 | 83.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-14BParameters=14B2026.01 | 83.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ParamΔModel Scale=70B2025.04 | 83.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Refinement-FTBackbone=Qwen-3-4B2026.03 | 83.73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpenseGPT+Model=Seed-OSS-36B-Instruct, MLP Sparsity=37.5%2026.06 | 83.73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |