Instruction Following on IF-Eval (Prompt Strict)
86.5Prompt Strict AccuracyClaude-3.5-Sonnet-1022
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude-3.5-Sonnet-10222025.01 | 86.5 | |
| Claude 3.5 Sonnet-1022Model Backbone=Claude 3.5 Sonnet2026.03 | 86.5 | |
| DeepSeek-V3Architecture=MoE, Activated Params=37B, Total Params=671B2025.01 | 86.1 | |
| OpenAI-o1-mini2025.01 | 84.8 | |
| OpenAI o1-miniModel Backbone=o1-mini2026.03 | 84.8 | |
| GPT-4o-05132025.01 | 84.3 | |
| GPT-4o 0513Model Backbone=GPT-4o2026.03 | 84.3 | |
| DeepSeek-R1Architecture=MoE, Activated Params=37B, Total Params=671B2025.01 | 83.3 | |
| R1-Distill-Qwen-14BModel Backbone=Qwen-14B2026.03 | 78.3 | |
| Qwen3# Total Params=1.7B2026.05 | 68.2 | |
| MiMo-RL 7B-R-TAPModel Backbone=7B2026.03 | 68 | |
| openPangu-Embedded KD# Total Params=1B, Training Stage=KD (NPD)2026.05 | 65.43 | |
| MiMo 7B-RLModel Backbone=7B2026.03 | 61 | |
| openPangu-Embedded RL# Total Params=1B, Training Stage=RL2026.05 | 60.81 | |
| R1-Distill-Qwen-7BModel Backbone=Qwen-7B2026.03 | 60.5 | |
| openPangu-Embedded SFT# Total Params=1B, Training Stage=SFT2026.05 | 56.38 | |
| Qwen3# Total Params=0.6B2026.05 | 54.5 | |
| Gemma3# Total Params=1B2026.05 | 51.57 | |
| MiniCPM4# Total Params=0.5B2026.05 | 50.28 | |
| Qwen2.5# Total Params=1.5B2026.05 | 42.5 | |
| QwQ-32B PreviewModel Backbone=QwQ-32B2026.03 | 40.4 | |
| Llama3.2# Total Params=1B2026.05 | 39.37 |