Multi-turn Dialogue on MT-Bench (GPT-4 Score)
8.9GPT-4 ScoreUAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| UAPOBackbone=Gemma-2-9B-Instruct2025.09 | 8.9 | |
| SimUAPOBackbone=Gemma-2-9B-Instruct2025.09 | 8.9 | |
| SimPOBackbone=Gemma-2-9B-Instruct2025.09 | 8.8 | |
| IPOBackbone=Gemma-2-9B-Instruct2025.09 | 8.7 | |
| CPOBackbone=Gemma-2-9B-Instruct2025.09 | 8.7 | |
| DPOBackbone=Gemma-2-9B-Instruct2025.09 | 8.7 | |
| SFTBackbone=Gemma-2-9B-Instruct2025.09 | 8.6 | |
| KTOBackbone=Gemma-2-9B-Instruct2025.09 | 8.5 | |
| R-DPOBackbone=Gemma-2-9B-Instruct2025.09 | 8.5 | |
| ORPOBackbone=Llama-3-8B-Instruct2025.09 | 8.3 | |
| SimUAPOBackbone=Llama-3-8B-Instruct2025.09 | 8.3 | |
| ORPOBackbone=Gemma-2-9B-Instruct2025.09 | 8.3 | |
| IPOBackbone=Llama-3-8B-Instruct2025.09 | 8.2 | |
| CPOBackbone=Llama-3-8B-Instruct2025.09 | 8.2 | |
| KTOBackbone=Llama-3-8B-Instruct2025.09 | 8.2 | |
| R-DPOBackbone=Llama-3-8B-Instruct2025.09 | 8.2 | |
| DPOBackbone=Llama-3-8B-Instruct, Source=Meng et al. (2024)2025.09 | 8.2 | |
| DPOBackbone=Llama-3-8B-Instruct2025.09 | 8.2 | |
| UAPOBackbone=Llama-3-8B-Instruct2025.09 | 8.2 | |
| SFTBackbone=Llama-3-8B-Instruct2025.09 | 8.1 | |
| SimPOBackbone=Llama-3-8B-Instruct, Source=Meng et al. (2024)2025.09 | 8 | |
| IPOBackbone=Mistral-7B-Instruct2025.09 | 7.8 | |
| KTOBackbone=Mistral-7B-Instruct2025.09 | 7.7 | |
| ORPOBackbone=Mistral-7B-Instruct2025.09 | 7.7 | |
| UAPOBackbone=Mistral-7B-Instruct2025.09 | 7.7 | |
| DPOBackbone=Mistral-7B-Instruct, Source=Meng et al. (2024)2025.09 | 7.6 | |
| DPOBackbone=Mistral-7B-Instruct2025.09 | 7.6 | |
| SimPOBackbone=Mistral-7B-Instruct, Source=Meng et al. (2024)2025.09 | 7.6 | |
| SimUAPOBackbone=Mistral-7B-Instruct2025.09 | 7.6 | |
| SFTBackbone=Mistral-7B-Instruct2025.09 | 7.5 | |
| CPOBackbone=Mistral-7B-Instruct2025.09 | 7.5 | |
| R-DPOBackbone=Mistral-7B-Instruct2025.09 | 7.5 | |
| SimPOBackbone=Llama-3-8B-Instruct2025.09 | 7.4 | |
| SimPOBackbone=Mistral-7B-Instruct2025.09 | 7.2 |