Multi-turn Chat Evaluation on MT-Bench (val)
7.925ScoreDPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DPOBase Model=Meta-Llama-3-8B-Instruct, Training Epochs=1, Training Dataset=TL;DR, Adaptation=LoRA2026.02 | 7.925 | |
| SQUAREDPOBase Model=Meta-Llama-3-8B-Instruct, Training Epochs=1, Training Dataset=TL;DR, Adaptation=LoRA2026.02 | 7.924 | |
| χPOBase Model=Meta-Llama-3-8B-Instruct, Training Epochs=1, Training Dataset=TL;DR, Adaptation=LoRA2026.02 | 7.9 |