Instruction Following on IFBench, IFEval, IFEval-ko
86.1AccuracyGLM-4.6
Evaluation Results
| Method | Links | |
|---|---|---|
| GLM-4.6Thinking Mode=true, Parameters=357B-A32B, Lang=English, Prompt Strategy=strict, Sub-Dataset=IFEval2026.01 | 86.1 | |
| GLM-4.6Thinking Mode=true, Parameters=357B-A32B, Lang=Korean, Prompt Strategy=strict, Sub-Dataset=IFEval-ko2026.01 | 85.8 | |
| DeepSeek-V3.1Thinking Mode=true, Parameters=685B-A37B, Lang=English, Prompt Strategy=strict, Sub-Dataset=IFEval2026.01 | 84.4 | |
| A.X K1Thinking Mode=true, Parameters=519B-A33B, Lang=Korean, Prompt Strategy=strict, Sub-Dataset=IFEval-ko2026.01 | 81 | |
| A.X K1Thinking Mode=true, Parameters=519B-A33B, Lang=English, Prompt Strategy=strict, Sub-Dataset=IFEval2026.01 | 80.4 | |
| DeepSeek-V3.1Thinking Mode=true, Parameters=685B-A37B, Lang=Korean, Prompt Strategy=strict, Sub-Dataset=IFEval-ko2026.01 | 79.2 | |
| A.X K1Thinking Mode=true, Parameters=519B-A33B, Lang=English, Prompt Strategy=loose, Sub-Dataset=IFBench2026.01 | 64.7 | |
| GLM-4.6Thinking Mode=true, Parameters=357B-A32B, Lang=English, Prompt Strategy=loose, Sub-Dataset=IFBench2026.01 | 43.4 | |
| DeepSeek-V3.1Thinking Mode=true, Parameters=685B-A37B, Lang=English, Prompt Strategy=loose, Sub-Dataset=IFBench2026.01 | 41.5 |