Instruction Following on IFBench (Score)
75.4IFBench ScoreGPT-5.2
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.22026.03 | 75.4 | |
| Intern-S1-ProNumber of Parameters=1T-A22B2026.03 | 71.2 | |
| Gemini-3-Pro2026.03 | 70.4 | |
| Kimi-K2.5Number of Parameters=1T-A32B2026.03 | 69.7 | |
| Qwen3-VL-235B-ThinkingNumber of Parameters=235B-A22B, Thinking Configuration=true2026.03 | 58.7 | |
| GOLFBackbone=Qwen-3-8B2026.03 | 38.33 | |
| GOLFBackbone=Qwen-3-4B2026.03 | 37.67 | |
| Critique-GRPOBackbone=Qwen-3-8B2026.03 | 36.33 | |
| Critique-GRPOBackbone=Qwen-3-4B2026.03 | 35.67 | |
| GRPOBackbone=Qwen-3-8B2026.03 | 35.65 | |
| Refinement-FTBackbone=Qwen-3-8B2026.03 | 34.33 | |
| Critique-FTBackbone=Qwen-3-8B2026.03 | 33.6 | |
| GRPOBackbone=Qwen-3-4B2026.03 | 33.33 | |
| Critique-FTBackbone=Qwen-3-4B2026.03 | 31.67 | |
| Refinement-FTBackbone=Qwen-3-4B2026.03 | 30.44 | |
| Qwen-3-8BTraining Method=SFT2026.03 | 27 | |
| Qwen-3-4BTraining Method=SFT2026.03 | 23.67 | |
| ExGRPOreward_type=continuous preference-model rewards2025.10 | 20.7 | |
| GRPOreward_type=continuous preference-model rewards2025.10 | 18.7 |