Instruction Following on Multi-IF
85.56ScoreERNIE 5.0
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ERNIE 5.02026.02 | 85.56 | — | |
| Gemini 3-Pro2026.02 | 81.15 | — | |
| Claude-Opus-4.7Stage=-2026.05 | 78.2 | — | |
| Gemini 2.5-Pro2026.02 | 76.1 | — | |
| DS V3.2-Thinking2026.02 | 71.17 | — | |
| GPT-4oStage=-2026.05 | 71.1 | — | |
| GPT-5 (High)2026.02 | 70 | — | |
| VERIF-8BStage=-2026.05 | 66.2 | — | |
| Self-Supervised-7BStage=-2026.05 | 64.3 | — | |
| Llama-3.1-8B-InstructStage=Iter32026.05 | 62.4 | — | |
| Qwen2.5-7B-InstructStage=Iter32026.05 | 61.9 | — | |
| Llama-3.1-8B-InstructStage=Iter22026.05 | 61.6 | — | |
| Qwen2.5-7B-InstructStage=Iter22026.05 | 61.5 | — | |
| Llama-3.1-8B-InstructStage=Iter12026.05 | 61.3 | — | |
| Qwen2.5-7B-InstructStage=Iter12026.05 | 61 | — | |
| Llama-3.1-8B-InstructStage=BASE2026.05 | 59.5 | — | |
| Qwen2.5-7B-InstructStage=BASE2026.05 | 59 | — | |
| Distill-Qwen-14BStage=Iter22026.05 | 57.3 | — | |
| Distill-Qwen-14BStage=Iter12026.05 | 57 | — | |
| Distill-Qwen-14BStage=Iter32026.05 | 56.8 | — | |
| Qwen3-1.7B# Total Params=1.7B, # Trained Tokens=36T2025.11 | 56.28 | — | |
| QwQ-32BStage=-2026.05 | 56.2 | — | |
| RAIF-7BStage=-2026.05 | 56.1 | — | |
| R1-0528-Qwen3-8BStage=Iter32026.05 | 53.2 | — | |
| Distill-Qwen-14BStage=BASE2026.05 | 53 | — | |
| R1-0528-Qwen3-8BStage=Iter22026.05 | 52.6 | — | |
| R1-0528-Qwen3-8BStage=Iter12026.05 | 52.4 | — | |
| R1-0528-Qwen3-8BStage=BASE2026.05 | 48.4 | — | |
| LFM2-1.2B# Total Params=1.2B, # Trained Tokens=11T2025.11 | 45.28 | — | |
| Qwen3-0.6B# Total Params=0.6B, # Trained Tokens=36T2025.11 | 45.13 | — | |
| Gemma-3-1B# Total Params=1B, # Trained Tokens=2T2025.11 | 44.49 | — | |
| LFM2-700M# Total Params=0.70B, # Trained Tokens=11T2025.11 | 40.92 | — | |
| SPAR-8B-DPOStage=-2026.05 | 39.6 | — | |
| LFM2-350M# Total Params=0.35B, # Trained Tokens=11T2025.11 | 32.85 | — | |
| Qwen2.5-1.5B-InstructStage=Iter12026.05 | 32.1 | — | |
| Qwen2.5-1.5B-InstructStage=Iter32026.05 | 32 | — | |
| Qwen2.5-1.5B-InstructStage=BASE2026.05 | 31.7 | — | |
| Qwen2.5-1.5B-InstructStage=Iter22026.05 | 31.7 | — | |
| Crab-7B-DPOStage=-2026.05 | 31.4 | — | |
| Conifer-7B-DPOStage=-2026.05 | 29.6 | — | |
| Llama-3.2-1B# Total Params=1.2B, # Trained Tokens=9T2025.11 | 29.43 | — | |
| Claude-Sonnet-4.5Model=Claude-Sonnet-4.52026.04 | — | 81.57 | |
| Deeepseek-V3.2Model=Deeepseek-V3.22026.04 | — | 74.14 | |
| Gemini-3.0-ProModel=Gemini-3.0-Pro2026.04 | — | 83.1 | |
| Gemma-3-4BTotal Parameters=4B, Active Parameters=4B, Trained Tokens=4T2025.11 | — | 66.61 | |
| Granite-4.0-HTotal Parameters=7B, Active Parameters=1B, Trained Tokens=15T2025.11 | — | 52.99 | |
| LFM2-2.6BTotal Parameters=2.6B, Active Parameters=2.6B, Trained Tokens=11T2025.11 | — | 60.26 | |
| LFM2-8B-A1BTotal Parameters=8.3B, Active Parameters=1.5B, Trained Tokens=13T2025.11 | — | 58.19 | |
| Llama-3.2-3BTotal Parameters=3.2B, Active Parameters=3.2B, Trained Tokens=9T2025.11 | — | 50.91 | |
| Qwen2.5-32B-instModel=Qwen2.5-32B-inst2026.04 | — | 64.45 | |
| Qwen2.5-32B-inst RLVRModel=Qwen2.5-32B-inst, Reward Model=Qwen2.5-32B2026.04 | — | 68.23 | |
| Qwen2.5-32B-inst RLVRModel=Qwen2.5-32B-inst, Reward Model=Qwen3-32B2026.04 | — | 68.29 | |
| Qwen2.5-7B-instModel=Qwen2.5-7B-inst2026.04 | — | 51.05 | |
| Qwen2.5-7B-inst RLVRModel=Qwen2.5-7B-inst, Reward Model=Qwen3-8B2026.04 | — | 57.15 | |
| Qwen2.5-7B-inst RLVRModel=Qwen2.5-7B-inst, Reward Model=Qwen2.5-32B2026.04 | — | 57.5 | |
| Qwen2.5-7B-inst RLVRModel=Qwen2.5-7B-inst, Reward Model=Qwen3-32B2026.04 | — | 57.08 | |
| Qwen3-32BModel=Qwen3-32B2026.04 | — | 70.7 | |
| Qwen3-4BTotal Parameters=4B, Active Parameters=4B, Trained Tokens=36T2025.11 | — | 75.54 | |
| Qwen3-8BModel=Qwen3-8B2026.04 | — | 70.36 | |
| SmolLM3-3BTotal Parameters=3.1B, Active Parameters=3.1B, Trained Tokens=11T2025.11 | — | 58.86 | |
| TinyJudge-32BModel=Qwen2.5-32B-inst, Reward Model=TinyJudge-32B2026.04 | — | 73.57 | |
| TinyJudge-7BModel=Qwen2.5-7B-inst, Reward Model=TinyJudge-7B2026.04 | — | 64.9 |