Instruction Following on Multi-IF PT
88AccuracyGemini-3 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3 ProModel variant=high2026.03 | 88 | |
| gpt-5.2Model variant=high2026.03 | 87.2 | |
| Gemini-3 ProModel variant=low2026.03 | 86 | |
| kimi-k2Model variant=thinking2026.03 | 86 | |
| gpt-5-miniPrice Range=cost-effective2026.03 | 85.8 | |
| Qwen3Model variant=235b2026.03 | 84.4 | |
| gpt-5.2Model variant=instant2026.03 | 83.7 | |
| gpt-4.12026.03 | 82.7 | |
| sabia-42026.03 | 82 | |
| gpt-oss-120bPrice Range=cost-effective2026.03 | 82 | |
| deepseekModel variant=v3.22026.03 | 81.5 | |
| sabiazinho-4Price Range=cost-effective2026.03 | 81 | |
| gemini-2.5-flash-litePrice Range=cost-effective2026.03 | 80.8 | |
| sabia-3.12026.03 | 80.7 | |
| gpt-4.1-miniPrice Range=cost-effective2026.03 | 79.6 |