Proactive Next Utterance Prediction on LMSYS (test)
60.98LLM-JudgeProUtt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ProUttCategory=Data Synthesis, Strategy=SFT + DPO, Backbone=Qwen3-8B2025.12 | 60.98 | 76.98 | |
| ProUttCategory=Data Synthesis, Strategy=SFT + SimPO, Backbone=Qwen3-8B2025.12 | 60.56 | 73.09 | |
| ProUttCategory=Data Synthesis, Strategy=SFT + ORPO, Backbone=Qwen3-8B2025.12 | 59.16 | 74.17 | |
| ProUttCategory=Data Synthesis, Strategy=SFT, Backbone=Qwen3-8B2025.12 | 58.1 | 76.3 | |
| GLM-4.6Category=Prompt-based LLMs2025.12 | 56.1 | 72.08 | |
| MAGPIECategory=Data Synthesis, Strategy=DPO2025.12 | 55.19 | 71.16 | |
| BaizeCategory=Data Synthesis2025.12 | 55.09 | 74.42 | |
| MAGPIECategory=Data Synthesis, Strategy=SFT2025.12 | 54.79 | 71.91 | |
| DeepSeek-V3.2-ExpCategory=Prompt-based LLMs2025.12 | 53.5 | 74.09 | |
| Doubao-1.5-ProCategory=Prompt-based LLMs2025.12 | 53.1 | 72.45 | |
| Qwen3-MaxCategory=Prompt-based LLMs2025.12 | 53.1 | 74.32 | |
| SPaRCategory=Data Synthesis, Strategy=DPO2025.12 | 52.9 | 72.75 | |
| SPaRCategory=Data Synthesis, Strategy=SFT2025.12 | 51.2 | 70.86 | |
| Doubao-Seed-1.6Category=Prompt-based LLMs2025.12 | 50.5 | 72.67 | |
| SocraticCategory=User Simulators2025.12 | 49.5 | 72.51 | |
| Qwen3-8BCategory=Prompt-based LLMs2025.12 | 45.7 | 69.9 | |
| USPCategory=User Simulators2025.12 | 38.9 | 70.97 |