Empathetic Dialogue Evaluation on Chinese Empathetic Dialogue (test)
3.0495NSGroundTruth
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| GroundTruth2026.01 | 3.0495 | 3.583 | 2.6949 | 2.7291 | 3.0141 | — | 3.81 | — | 3.48 | |
| ReEmpathyReflective Inference Mechanism=Enabled2026.01 | 2.9965 | 3.5824 | 2.624 | 2.6525 | 2.9633 | -0.046 | 3.818 | -0.082 | 3.43 | |
| GLM-4-VoiceOptimization Strategy=SFT2026.01 | 2.9795 | 3.5758 | 2.622 | 2.6445 | 2.9555 | -0.096 | 3.734 | -0.156 | 3.402 | |
| ReEmpathyReflective Inference Mechanism=Disabled2026.01 | 2.9744 | 3.5609 | 2.5975 | 2.6244 | 2.9393 | -0.122 | 3.726 | -0.126 | 3.38 | |
| GLM-4-VoiceOptimization Strategy=DPO2026.01 | 2.9706 | 3.5657 | 2.6009 | 2.6247 | 2.9405 | -0.132 | 3.726 | -0.12 | 3.356 | |
| GLM-4-VoiceOptimization Strategy=CoTBS2026.01 | 2.9535 | 3.5335 | 2.5594 | 2.5834 | 2.9074 | -0.154 | 3.726 | -0.154 | 3.368 | |
| GLM-4-Voice2026.01 | 2.8983 | 3.43 | 2.4167 | 2.4117 | 2.7892 | -0.33 | 3.616 | -0.458 | 3.308 | |
| Qwen2.5-Omni2026.01 | 2.8379 | 3.3239 | 2.3542 | 2.3691 | 2.7213 | -0.562 | 3.292 | -0.362 | 2.978 | |
| Kimi-Audio2026.01 | 2.6604 | 3.2758 | 2.2496 | 2.2026 | 2.5971 | -0.628 | 3.14 | -0.386 | 2.976 |