Instruction Following on IFBench (Accuracy)
77.8AccuracyQwen-3.5 27B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen-3.5 27BSpeedup @32k=0.55x, Speedup @16k=0.5x2026.04 | 77.8 | |
| Qwen3.5-27BArchitecture=Dense, # Total Params=27B, # Activated Params=27B, Reasoning Mode=REASONING2026.04 | 76.5 | |
| Nemotron 3 Nano OmniOpen-Source=✓, Size=30B-A3B, prompt=true2026.04 | 74.2 | |
| GPT-5 miniReasoning Mode=REASONING: HIGH2026.04 | 74 | |
| Qwen3.5-122B-A10BEvaluation level=prompt2026.04 | 73.77 | |
| Nemotron 3 SuperEvaluation level=prompt2026.04 | 72.56 | |
| Nemotron-3-Nano 30BSpeedup @32k=4.09x, Speedup @16k=2.8x2026.04 | 71.5 | |
| Nemotron 3 Nano 30B-A3BOpen-Source=✓, Size=30B-A3B, prompt=true2026.04 | 71.5 | |
| GPT-OSS-120BEvaluation level=prompt2026.04 | 68.32 | |
| gpt-oss-puzzle-88BReasoning effort=High, KV cache precision=BF162026.02 | 67.77 | |
| K-EXAONE-236B-A23BArchitecture=MoE, # Total Params=236B, # Activated Params=23B, Reasoning Mode=REASONING2026.04 | 67.3 | |
| gpt-oss-puzzle-88BReasoning effort=High, KV cache precision=FP82026.02 | 67.01 | |
| Apriel-1.6Speedup @32k=1.0x, Speedup @16k=1.0x2026.04 | 66.5 | |
| gpt-oss-120BReasoning effort=High, KV cache precision=FP82026.02 | 65.76 | |
| gpt-oss-puzzle-88BReasoning effort=Medium, KV cache precision=BF162026.02 | 65.56 | |
| gpt-oss-120BReasoning effort=High, KV cache precision=BF162026.02 | 64.46 | |
| gpt-oss-puzzle-88BReasoning effort=Medium, KV cache precision=FP82026.02 | 63.35 | |
| Reg|Lklhd–26Speedup @32k=2.85x, Speedup @16k=1.5x2026.04 | 63.1 | |
| all-attentionSpeedup @32k=1.0x, Speedup @16k=1.0x2026.04 | 63.1 | |
| EXAONE 4.5 33BArchitecture=Dense, # Total Params=33B, # Activated Params=32B, Reasoning Mode=REASONING2026.04 | 62.6 | |
| Falcon-H1R 7BSpeedup @32k=4.61x, Speedup @16k=3.4x2026.04 | 60.5 | |
| S1: Distil. Idealized|All–6Speedup @32k=6.13x, Speedup @16k=2.5x2026.04 | 59.9 | |
| Reg|Lklhd–18Speedup @32k=4.76x, Speedup @16k=2.2x2026.04 | 59.3 | |
| Qwen3-VL-235B-A22BArchitecture=MoE, # Total Params=236B, # Activated Params=22B, Reasoning Mode=Thinking2026.04 | 59.2 | |
| Idealized|All–18Speedup @32k=1.99x, Speedup @16k=1.1x2026.04 | 58.8 | |
| gpt-oss-120BReasoning effort=Medium, KV cache precision=FP82026.02 | 58.67 | |
| Reg|Lklhd–13Speedup @32k=6.9x, Speedup @16k=2.7x2026.04 | 57.1 | |
| gpt-oss-120BReasoning effort=Medium, KV cache precision=BF162026.02 | 56.55 | |
| gpt-oss-puzzle-88BReasoning effort=Low, KV cache precision=BF162026.02 | 56.38 | |
| gpt-oss-puzzle-88BReasoning effort=Low, KV cache precision=FP82026.02 | 56.21 | |
| Reg|Lklhd–10Speedup @32k=10.69x, Speedup @16k=4.2x2026.04 | 56.2 | |
| Idealized|All–6Speedup @32k=6.13x, Speedup @16k=2.5x2026.04 | 55.3 | |
| Idealized|Lklhd–6Speedup @32k=6.2x, Speedup @16k=2.4x2026.04 | 54.9 | |
| gpt-oss-120BReasoning effort=Low, KV cache precision=BF162026.02 | 44.13 | |
| gpt-oss-120BReasoning effort=Low, KV cache precision=FP82026.02 | 43.71 | |
| DPOBackbone=olmo-3.1-32b-it-sft2026.04 | 36.1 | |
| Mag+Backbone=olmo-3.1-32b-it-sft2026.04 | 35.4 | |
| Pair+Backbone=olmo-3.1-32b-it-sft2026.04 | 35 | |
| Pair+Backbone=olmo-3-7b-it-sft2026.04 | 34.4 | |
| Soft+Backbone=olmo-3.1-32b-it-sft2026.04 | 34.4 | |
| Nemotron-Nano 12B v2Speedup @32k=5.85x, Speedup @16k=4.3x2026.04 | 34.2 | |
| MPO+Backbone=olmo-3.1-32b-it-sft2026.04 | 33.3 | |
| Soft+Backbone=olmo-3-7b-it-sft2026.04 | 32.7 | |
| BaseBackbone=olmo-3.1-32b-it-sft2026.04 | 32.7 | |
| MPO+Backbone=olmo-3-7b-it-sft2026.04 | 31.3 | |
| Mag+Backbone=olmo-3-7b-it-sft2026.04 | 30.3 | |
| Qwen3-4BTotal Parameters=4B, Active Parameters=4B, Trained Tokens=36T2025.11 | 30.28 | |
| OLMo-Hybrid-Think 7BSpeedup @32k=2.51x, Speedup @16k=2.1x2026.04 | 30 | |
| Apriel-H1 15BSpeedup @32k=1.97x, Speedup @16k=1.9x2026.04 | 29.8 | |
| DPOBackbone=olmo-3-7b-it-sft2026.04 | 29.6 | |
| BaseBackbone=olmo-3-7b-it-sft2026.04 | 28.6 | |
| LFM2-8B-A1BTotal Parameters=8.3B, Active Parameters=1.5B, Trained Tokens=13T2025.11 | 25.85 | |
| Pair+Backbone=gemma-3-4b-sft2026.04 | 24.5 | |
| RFTBackbone=olmo-3.1-32b-it-sft2026.04 | 24.1 | |
| Gemma-3-4BTotal Parameters=4B, Active Parameters=4B, Trained Tokens=4T2025.11 | 23.53 | |
| DPOBackbone=gemma-3-4b-sft2026.04 | 22.8 | |
| LFM2-2.6BTotal Parameters=2.6B, Active Parameters=2.6B, Trained Tokens=11T2025.11 | 22.19 | |
| Soft+Backbone=gemma-3-4b-sft2026.04 | 21.8 | |
| Mag+Backbone=gemma-3-4b-sft2026.04 | 21.1 | |
| MPO+Backbone=gemma-3-4b-sft2026.04 | 21.1 | |
| RFTBackbone=olmo-3-7b-it-sft2026.04 | 21.1 | |
| Llama-3.2-3BTotal Parameters=3.2B, Active Parameters=3.2B, Trained Tokens=9T2025.11 | 20.78 | |
| OLMo3-7B-Think-DPO + GRPO (FLIP)Reward Model=Qwen3-1.7B FLIP, Training Method=GRPO2026.02 | 20.5 | |
| BaseBackbone=gemma-3-4b-sft2026.04 | 20.4 | |
| OLMo3-7B-Think-DPO + GRPO (FLIP)Reward Model=Qwen3-4B FLIP, Training Method=GRPO2026.02 | 20.1 | |
| OLMo3-7B-ThinkStatus=Final version after RLVR2026.02 | 19.8 | |
| OLMo3-7B-Think-DPO + GRPOReward Model=Qwen3-4B LLM-as-a-Judge, Training Method=GRPO2026.02 | 19.6 | |
| OLMo3-7B-Think-DPO + GRPOReward Model=Qwen3-1.7B LLM-as-a-Judge, Training Method=GRPO2026.02 | 19.5 | |
| OLMo3-7B-Think-DPOBase Model=OLMo3-7B2026.02 | 18.8 | |
| Granite-4.0-HTotal Parameters=7B, Active Parameters=1B, Trained Tokens=15T2025.11 | 18.37 | |
| SmolLM3-3BTotal Parameters=3.1B, Active Parameters=3.1B, Trained Tokens=11T2025.11 | 17.93 | |
| RFTBackbone=gemma-3-4b-sft2026.04 | 16 |