Instruction Following on AlpacaEval MIX-14K gpt4_turbo (test)
17.269LC Win RateDDRO
Evaluation Results
| Method | Links | |
|---|---|---|
| DDROBase Model=Llama-8B, Preference Dataset=MIX-14K2026.04 | 17.269 | |
| RDROBase Model=Llama-8B, Preference Dataset=MIX-14K2026.04 | 17.102 | |
| KTOBase Model=Llama-8B, Preference Dataset=MIX-14K2026.04 | 13.921 | |
| KTOBase Model=Llama-3B, Preference Dataset=MIX-14K2026.04 | 12.763 | |
| RDROBase Model=Llama-3B, Preference Dataset=MIX-14K2026.04 | 12.72 | |
| DDROBase Model=Llama-3B, Preference Dataset=MIX-14K2026.04 | 12.487 | |
| RDROBase Model=Qwen-3B, Preference Dataset=MIX-14K2026.04 | 8.793 | |
| DDROBase Model=Qwen-3B, Preference Dataset=MIX-14K2026.04 | 8.458 | |
| KTOBase Model=Qwen-3B, Preference Dataset=MIX-14K2026.04 | 8.24 | |
| KTOBase Model=Qwen-1.5B, Preference Dataset=MIX-14K2026.04 | 5.32 | |
| RDROBase Model=Qwen-1.5B, Preference Dataset=MIX-14K2026.04 | 5.297 | |
| DDROBase Model=Qwen-1.5B, Preference Dataset=MIX-14K2026.04 | 5.169 |