Instruction Following on IFEval (Score %)
85.4Score (%)Qwen3-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-8Binference_mode=thinking mode2026.06 | 85.4 | |
| Teacher Bestinference_mode=thinking mode2026.06 | 84.8 | |
| MOPDinference_mode=thinking mode2026.06 | 77.26 | |
| Base (SFT)inference_mode=thinking mode2026.06 | 63.77 | |
| Task ArithmeticModel Scale=Llama-3.1-3B, Quantization Bit-width=Full-precision, Merging Algorithm=Task Arithmetic2026.05 | 62.48 | |
| E-PMQModel Scale=Llama-3.1-3B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 62.48 | |
| AWQModel Scale=Llama-3.1-3B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 60.63 | |
| GPTQModel Scale=Llama-3.1-3B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 58.78 | |
| ARES-RL2026.05 | 54.88 | |
| ARES-RLBackbone=Qwen3-32B2026.05 | 54.88 | |
| Task ArithmeticModel Scale=Llama-3.1-8B, Quantization Bit-width=Full-precision, Merging Algorithm=Task Arithmetic2026.05 | 50.09 | |
| E-PMQModel Scale=Llama-3.1-8B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 48.8 | |
| ARES-SFT2026.05 | 46.41 | |
| ARES-SFTBackbone=Qwen3-32B2026.05 | 46.41 | |
| GPTQModel Scale=Llama-3.1-8B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 44.92 | |
| AWQModel Scale=Llama-3.1-8B, Quantization Bit-width=4-bit, Merging Algorithm=Task Arithmetic2026.05 | 44.73 | |
| CPT2026.05 | 39.39 | |
| CPTBackbone=Qwen3-32B2026.05 | 39.39 | |
| Webscale2026.05 | 35.61 | |
| WebscaleBackbone=Qwen3-32B2026.05 | 35.61 | |
| Natural Reasoning2026.05 | 28.15 | |
| NaturalReasoningBackbone=Qwen3-32B2026.05 | 28.15 |