Instruction Following on InfoBench (DRFR)
74.19DRFR ScorePolicy-adaptive rubrics
Evaluation Results
| Method | Links | |
|---|---|---|
| Policy-adaptive rubricsPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 74.19 | |
| WildChecklistsPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 73.8 | |
| LLM-as-a-TutorPrompt Modification Strategy=Policy-adaptive prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 73.59 | |
| Base rubricsPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 73.48 | |
| EVAPrompt Modification Strategy=Policy-adaptive prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 73.43 | |
| Evol-InstructPrompt Modification Strategy=Policy-unaware prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 73.35 | |
| Qwen3-1.7BPolicy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 72.28 | |
| DistillationPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 68.58 |