Social Dialogue on SOTOPIA Self-Chat
8.56GOALLlama-8B+BC+SDPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Llama-8B+BC+SDPOAlignment=BC + Segment-Level Direct Preference Optimization2025.01 | 8.56 | 3.69 | |
| LLaMA-8B+BC+SDPOBackbone=LLaMA-8B, Alignment=SDPO2026.02 | 8.56 | 3.69 | |
| SDPOBase Model=Mistral-v0.32025.01 | 8.48 | 3.49 | |
| LLaMA-8B+BC+ALPOBackbone=LLaMA-8B, Alignment=ALPO2026.02 | 8.41 | 3.56 | |
| DMPOBase Model=Mistral-v0.32025.01 | 8.34 | 3.26 | |
| ETOBase Model=Mistral-v0.32025.01 | 8.3 | 3.27 | |
| Llama-8B+BC+ETOAlignment=BC + ETO2025.01 | 8.29 | 3.39 | |
| LLaMA-8B+BC+ETOBackbone=LLaMA-8B, Alignment=ETO2026.02 | 8.29 | 3.39 | |
| Llama-8B+BC+DMPOAlignment=BC + DMPO2025.01 | 8.28 | 3.37 | |
| LLaMA-8B+BC+DMPOBackbone=LLaMA-8B, Alignment=DMPO2026.02 | 8.28 | 3.37 | |
| GPT-4-turbo2025.01 | 8.18 | 2.96 | |
| GPT-4-turbo2026.02 | 8.18 | 2.96 | |
| DPOBase Model=Mistral-v0.32025.01 | 8.13 | 3.13 | |
| Llama-8B+BC+DPOAlignment=BC + DPO2025.01 | 7.95 | 3.28 | |
| LLaMA-8B+BC+DPOBackbone=LLaMA-8B, Alignment=DPO2026.02 | 7.95 | 3.28 | |
| GPT-4o2025.01 | 7.9 | 2.67 | |
| GPT-4o2026.02 | 7.9 | 2.67 | |
| BCBase Model=Mistral-v0.32025.01 | 7.89 | 2.98 | |
| Llama-8B+BCAlignment=Behavioral Cloning2025.01 | 7.81 | 3.05 | |
| LLaMA-8B+BCBackbone=LLaMA-8B, Training=Behavioral Cloning2026.02 | 7.81 | 3.05 | |
| Llama-8B+BC+Preferred-SFTAlignment=BC + Preferred-SFT2025.01 | 7.76 | 3.05 | |
| LLaMA-8B+BC+Preferred-SFTBackbone=LLaMA-8B, Training=BC + Preferred-SFT2026.02 | 7.76 | 3.05 | |
| Llama-8B2025.01 | 7.24 | 1.94 | |
| LLaMA-8BBackbone=LLaMA-8B2026.02 | 7.24 | 1.94 | |
| GPT-4o-mini2025.01 | 6.98 | 2.11 | |
| GPT-4o-mini2026.02 | 6.98 | 2.11 | |
| GPT-3.5-turbo2025.01 | 6.38 | 1.36 | |
| GPT-3.5-turbo2026.02 | 6.38 | 1.36 |