Proactive next utterance prediction on CrossWOZ (test)
51.22LLM-JudgeProUtt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ProUttCategory=Data Synthesis, Strategy=SFT + DPO, Backbone=Qwen3-8B2025.12 | 51.22 | 53.5 | |
| ProUttCategory=Data Synthesis, Strategy=SFT + ORPO, Backbone=Qwen3-8B2025.12 | 48.28 | 54.15 | |
| ProUttCategory=Data Synthesis, Strategy=SFT + SimPO, Backbone=Qwen3-8B2025.12 | 46.7 | 52.77 | |
| BaizeCategory=Data Synthesis2025.12 | 46.1 | 53.91 | |
| ProUttCategory=Data Synthesis, Strategy=SFT, Backbone=Qwen3-8B2025.12 | 45.98 | 53.59 | |
| DeepSeek-V3.2-ExpCategory=Prompt-based LLMs2025.12 | 43.6 | 54.05 | |
| SPaRCategory=Data Synthesis, Strategy=DPO2025.12 | 41.4 | 53.22 | |
| SocraticCategory=User Simulators2025.12 | 40.9 | 53.92 | |
| SPaRCategory=Data Synthesis, Strategy=SFT2025.12 | 40.9 | 52.91 | |
| Doubao-1.5-ProCategory=Prompt-based LLMs2025.12 | 40.01 | 51.94 | |
| Qwen3-MaxCategory=Prompt-based LLMs2025.12 | 39 | 54.04 | |
| MAGPIECategory=Data Synthesis, Strategy=DPO2025.12 | 39 | 53.17 | |
| MAGPIECategory=Data Synthesis, Strategy=SFT2025.12 | 38 | 53.97 | |
| GLM-4.6Category=Prompt-based LLMs2025.12 | 37.8 | 53.84 | |
| Qwen3-8BCategory=Prompt-based LLMs2025.12 | 37.7 | 53.91 | |
| Doubao-Seed-1.6Category=Prompt-based LLMs2025.12 | 37.1 | 53.06 | |
| USPCategory=User Simulators2025.12 | 14.7 | 48.21 |