Instruction Following on FollowBench (SSR/HSR)
70.2SSRDA-PT-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DA-PT-GRPOModel=Llama-3.2-3B-Instruct, Group Size (G)=82026.06 | 70.2 | 59.2 | |
| MT-GRPOModel=Llama-3.2-3B-Instruct, Group Size (G)=82026.06 | 70 | 59.9 | |
| BaselineModel=Llama-3.2-3B-Instruct, Group Size (G)=82026.06 | 69.7 | 59.8 | |
| DA-GRPOModel=Llama-3.2-3B-Instruct, Group Size (G)=82026.06 | 69.6 | 58.9 | |
| MDP-GRPOModel=Llama-3.2-3B-Instruct, Group Size (G)=82026.06 | 69.4 | 59.1 | |
| PT-GRPOModel=Llama-3.2-3B-Instruct, Group Size (G)=82026.06 | 69.3 | 57.6 | |
| GRPOModel=Llama-3.2-3B-Instruct, Group Size (G)=82026.06 | 68.4 | 58.9 | |
| DA-PT-GRPOModel=Gemma-2-2B-Instruct, Group Size (G)=82026.06 | 68.2 | 59.7 | |
| MDP-GRPOModel=Gemma-2-2B-Instruct, Group Size (G)=82026.06 | 66.9 | 57.4 | |
| PT-GRPOModel=Gemma-2-2B-Instruct, Group Size (G)=82026.06 | 66.5 | 56.1 | |
| DA-GRPOModel=Gemma-2-2B-Instruct, Group Size (G)=82026.06 | 65.4 | 56.1 | |
| MT-GRPOModel=Gemma-2-2B-Instruct, Group Size (G)=82026.06 | 64.3 | 53.7 | |
| GRPOModel=Gemma-2-2B-Instruct, Group Size (G)=82026.06 | 64 | 53.2 | |
| BaselineModel=Gemma-2-2B-Instruct, Group Size (G)=82026.06 | 63.7 | 52.9 | |
| LLM-as-a-TutorPrompt Modification Strategy=Policy-adaptive prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 62.28 | 40.91 | |
| Policy-adaptive rubricsPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 61.3 | 39.63 | |
| EVAPrompt Modification Strategy=Policy-adaptive prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 61.04 | 39.14 | |
| WildChecklistsPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 60.71 | 38.71 | |
| Base rubricsPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 60.17 | 38.6 | |
| Evol-InstructPrompt Modification Strategy=Policy-unaware prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 59.99 | 37.98 | |
| Qwen3-1.7BPolicy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 58.43 | 35.34 | |
| DistillationPrompt Modification Strategy=No prompt modification, Policy Model=Qwen3-1.7B, Tutor Model=Qwen3-8B, Judge Model=Qwen3-8B2026.07 | 57.15 | 34.67 |