Emotional Support Conversation on ESC-Eval
3DiversityDoubao-Pro-32k
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Doubao-Pro-32kModel Type=Close-Source LLM2026.03 | 3 | 1.98 | 2 | |
| SoulChat2.0-Qwen2-7BModel Type=Open-Source In-domain LLM2026.03 | 3 | 2 | 2 | |
| SoulChat2.0-Llama-3.1-8BModel Type=Open-Source In-domain LLM2026.03 | 3 | 2.01 | 2 | |
| Qwen-2.5-7b + RAPOTraining Strategy=RAPO2026.03 | 3 | 1.84 | 2 | |
| Llama-3-8b + RAPOTraining Strategy=RAPO2026.03 | 3 | 1.94 | 2 | |
| PsyChat-Qwen2.5-7BModel Type=Open-Source In-domain LLM2026.03 | 2.99 | 1.6 | 1.96 | |
| Qwen-2.5-7b + GRPOTraining Strategy=GRPO2026.03 | 2.99 | 1.66 | 1.98 | |
| Qwen-2.5-7b + CPOTraining Strategy=CPO2026.03 | 2.98 | 1.83 | 1.99 | |
| Qwen-2.5-7b + SFT-HDSTraining Strategy=SFT-HDS2026.03 | 2.97 | 1.98 | 2 | |
| Llama-3-8b + CPOTraining Strategy=CPO2026.03 | 2.96 | 2 | 1.99 | |
| Qwen-3-8b + CPOTraining Strategy=CPO2026.03 | 2.93 | 1.87 | 1.99 | |
| Llama-3-8b + SFT-HDSTraining Strategy=SFT-HDS2026.03 | 2.93 | 2.01 | 2 | |
| Llama-3-8b + GRPOTraining Strategy=GRPO2026.03 | 2.92 | 1.69 | 1.99 | |
| Qwen-3-8bTraining Strategy=Base2026.03 | 2.91 | 1.27 | 1.93 | |
| Qwen-3-8b + RAPOTraining Strategy=RAPO2026.03 | 2.91 | 2.01 | 2 | |
| Llama-3-8b + SFT-FullTraining Strategy=SFT-Full2026.03 | 2.91 | 2.01 | 2 | |
| Llama-3-8bTraining Strategy=Base2026.03 | 2.9 | 1.64 | 1.97 | |
| GPT-4o-2024-11-20Model Type=Close-Source LLM2026.03 | 2.89 | 1.36 | 1.86 | |
| Qwen-2.5-7b + SFT-FullTraining Strategy=SFT-Full2026.03 | 2.89 | 2.02 | 1.97 | |
| Qwen-3-8b + GRPOTraining Strategy=GRPO2026.03 | 2.89 | 1.76 | 1.89 | |
| GPT-5-2025-08-07Model Type=Close-Source LLM2026.03 | 2.78 | 1.68 | 1.98 | |
| Qwen-2.5-7bTraining Strategy=Base2026.03 | 2.61 | 0.96 | 1.27 | |
| Qwen-3-8b + SFT-HDSTraining Strategy=SFT-HDS2026.03 | 2.22 | 2.02 | 1.97 | |
| Qwen-3-8b + SFT-FullTraining Strategy=SFT-Full2026.03 | 2.14 | 2.01 | 1.94 |