Proactive next utterance prediction on ShareGPT (test)
52.66LLM-JudgeProUtt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ProUttCategory=Data Synthesis, Strategy=SFT + DPO, Backbone=Qwen3-8B2025.12 | 52.66 | 69.35 | |
| ProUttCategory=Data Synthesis, Strategy=SFT, Backbone=Qwen3-8B2025.12 | 50.12 | 69.08 | |
| GLM-4.6Category=Prompt-based LLMs2025.12 | 49.5 | 69.19 | |
| ProUttCategory=Data Synthesis, Strategy=SFT + SimPO, Backbone=Qwen3-8B2025.12 | 48.6 | 68.53 | |
| ProUttCategory=Data Synthesis, Strategy=SFT + ORPO, Backbone=Qwen3-8B2025.12 | 48 | 69.81 | |
| Qwen3-8BCategory=Prompt-based LLMs2025.12 | 46.4 | 67.06 | |
| DeepSeek-V3.2-ExpCategory=Prompt-based LLMs2025.12 | 46.4 | 68.24 | |
| BaizeCategory=Data Synthesis2025.12 | 46.3 | 68.19 | |
| Doubao-1.5-ProCategory=Prompt-based LLMs2025.12 | 46 | 68.76 | |
| SPaRCategory=Data Synthesis, Strategy=DPO2025.12 | 45.1 | 68.97 | |
| MAGPIECategory=Data Synthesis, Strategy=SFT2025.12 | 44.6 | 68.62 | |
| MAGPIECategory=Data Synthesis, Strategy=DPO2025.12 | 44.3 | 68.61 | |
| SPaRCategory=Data Synthesis, Strategy=SFT2025.12 | 43.9 | 68.93 | |
| Qwen3-MaxCategory=Prompt-based LLMs2025.12 | 43.6 | 68.85 | |
| Doubao-Seed-1.6Category=Prompt-based LLMs2025.12 | 42.7 | 68.78 | |
| SocraticCategory=User Simulators2025.12 | 32.4 | 66.31 | |
| USPCategory=User Simulators2025.12 | 27.7 | 66.31 |