Constraint Following on FollowBench SSR
84.7Success Rate (Level 1)GPT-4+
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GPT-4+2024.06 | 84.7 | 77.6 | 76.2 | 77.9 | 73.3 | 77.9 | |
| GPT-3.5 Turbo2024.06 | 80.3 | 71.2 | 74.2 | 69.6 | 67.1 | 72.5 | |
| AUTOIF (Qwen2-72B-Instruct w/ Online DPO)Backbone Model=Qwen2-72B-Instruct, Supervision Model=Qwen2-72B, Alignment Strategy=Self-Alignment, Training Method=Online DPO2024.06 | 76.2 | 69.8 | 67 | 61.6 | 62.8 | 67.5 | |
| AUTOIF (LLaMA-3-70B w/ Online DPO)Backbone Model=LLaMA3-70B-Instruct, Supervision Model=LLaMA3-70B, Alignment Strategy=Self-Alignment, Training Method=Online DPO2024.06 | 71 | 67.2 | 66.2 | 64.6 | 63.5 | 66.5 | |
| Qwen2-72B-InstructBackbone Model=Qwen2-72B-Instruct2024.06 | 70.2 | 66.6 | 63.5 | 58.1 | 56.3 | 62.9 | |
| Mixtral-8x22BBackbone Model=Mixtral-8x22B2024.06 | 63.9 | 60 | 58.2 | 56.2 | 55.3 | 58.7 | |
| AUTOIF (Qwen2-7B Offline DPO)Backbone Model=Qwen2-7B, Supervision Model=Qwen2-72B, Alignment Strategy=Strong-to-Weak, Training Method=Offline DPO2024.06 | 61.4 | 54.5 | 54.3 | 51.2 | 48.6 | 54 | |
| AUTOIF (Qwen2-7B Online DPO)Backbone Model=Qwen2-7B, Supervision Model=Qwen2-72B, Alignment Strategy=Strong-to-Weak, Training Method=Online DPO2024.06 | 61.4 | 56.8 | 57.8 | 55.4 | 51.6 | 56.6 | |
| LLaMA3-70B-InstructBackbone Model=LLaMA3-70B-Instruct2024.06 | 60.7 | 60.5 | 61.1 | 61.7 | 60.3 | 60.9 | |
| AUTOIF (Qwen2-7B-SFT)Backbone Model=Qwen2-7B, Supervision Model=Qwen2-72B, Alignment Strategy=Strong-to-Weak, Training Method=SFT2024.06 | 60.2 | 53.7 | 54.3 | 49.9 | 48.6 | 53.3 | |
| Qwen2-7B(ShareGPT)Backbone Model=Qwen2-7B, Training Data=ShareGPT2024.06 | 56.1 | 52.7 | 50.8 | 45.2 | 47.9 | 50.5 | |
| Qwen2-7BBackbone Model=Qwen2-7B2024.06 | 55.6 | 53.5 | 53.7 | 49.9 | 48.6 | 52.3 | |
| AUTOIF (LLaMA3-8B Online DPO)Backbone Model=LLaMA3-8B, Supervision Model=LLaMA3-70B, Alignment Strategy=Strong-to-Weak, Training Method=Online DPO2024.06 | 54.6 | 52.1 | 50 | 49 | 43.7 | 49.9 | |
| AUTOIF (LLaMA3-8B Offline DPO)Backbone Model=LLaMA3-8B, Supervision Model=LLaMA3-70B, Alignment Strategy=Strong-to-Weak, Training Method=Offline DPO2024.06 | 51.9 | 51.3 | 50.1 | 45.3 | 47.5 | 49.2 | |
| AUTOIF (LLaMA3-8B-SFT)Backbone Model=LLaMA3-8B, Supervision Model=LLaMA3-70B, Alignment Strategy=Strong-to-Weak, Training Method=SFT2024.06 | 46.6 | 46.2 | 45.9 | 37.6 | 41 | 43.5 | |
| LLaMA3-8B(ShareGPT)Backbone Model=LLaMA3-8B, Training Data=ShareGPT2024.06 | 44 | 40 | 39.6 | 33.3 | 33.6 | 38.1 | |
| Mistral-7BBackbone Model=Mistral-7B2024.06 | 40.1 | 39.7 | 37.9 | 35.7 | 36.7 | 38 | |
| LLaMA3-8BBackbone Model=LLaMA3-8B2024.06 | 10 | 10.3 | 10.5 | 14.3 | 12.7 | 11.6 |