Instruction Following on FollowBench + AdvancedIF + InfoBench Aggregate
51.96Average ScoreLLM-as-a-Tutor
Evaluation Results
| Method | Links | |
|---|---|---|
| LLM-as-a-TutorPrompt Modification Strategy=Policy-adaptive prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 51.96 | |
| Policy-adaptive rubricsPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 51.04 | |
| EVAPrompt Modification Strategy=Policy-adaptive prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 51.04 | |
| WildChecklistsPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 50.72 | |
| Base rubricsPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 50.51 | |
| Evol-InstructPrompt Modification Strategy=Policy-unaware prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 50.24 | |
| Qwen3-1.7BPolicy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 49.12 | |
| DistillationPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 46.05 |