Proactive next utterance prediction on WildChat (test)
52.16LLM-JudgeProUtt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ProUttCategory=Data Synthesis, Strategy=SFT + DPO, Backbone=Qwen3-8B2025.12 | 52.16 | 73.8 | |
| ProUttCategory=Data Synthesis, Strategy=SFT + ORPO, Backbone=Qwen3-8B2025.12 | 50.9 | 73.78 | |
| ProUttCategory=Data Synthesis, Strategy=SFT, Backbone=Qwen3-8B2025.12 | 50.8 | 73.22 | |
| ProUttCategory=Data Synthesis, Strategy=SFT + SimPO, Backbone=Qwen3-8B2025.12 | 50.5 | 73.89 | |
| MAGPIECategory=Data Synthesis, Strategy=DPO2025.12 | 49.7 | 70.81 | |
| Doubao-1.5-ProCategory=Prompt-based LLMs2025.12 | 49.6 | 71.18 | |
| DeepSeek-V3.2-ExpCategory=Prompt-based LLMs2025.12 | 48.9 | 71.06 | |
| BaizeCategory=Data Synthesis2025.12 | 48.5 | 73.15 | |
| MAGPIECategory=Data Synthesis, Strategy=SFT2025.12 | 47.9 | 70.51 | |
| GLM-4.6Category=Prompt-based LLMs2025.12 | 47.6 | 70.24 | |
| SPaRCategory=Data Synthesis, Strategy=DPO2025.12 | 45.4 | 69.68 | |
| SPaRCategory=Data Synthesis, Strategy=SFT2025.12 | 44.9 | 70.2 | |
| Doubao-Seed-1.6Category=Prompt-based LLMs2025.12 | 44.3 | 69.22 | |
| Qwen3-MaxCategory=Prompt-based LLMs2025.12 | 40.8 | 69.57 | |
| SocraticCategory=User Simulators2025.12 | 39.4 | 69.71 | |
| Qwen3-8BCategory=Prompt-based LLMs2025.12 | 38.5 | 64.1 | |
| USPCategory=User Simulators2025.12 | 31.1 | 67.06 |