Stage-wise response generation on CPCD-Bench
4.778LLM-as-a-Judge ScoreGPT-5.4
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5.4Model Type=General2026.05 | 4.778 | 4.626 | |
| Gemini-3-flash-previewModel Type=General2026.05 | 4.455 | 4.51 | |
| DeepSeek V3.2Model Type=General2026.05 | 4.397 | 4.312 | |
| Qwen3-MaxModel Type=General2026.05 | 4.231 | 4.123 | |
| Kimi-k2.5Model Type=General2026.05 | 4.212 | 4.225 | |
| GLM-5.1Model Type=General2026.05 | 4.198 | 4.186 | |
| MiniMax M2.7Model Type=General2026.05 | 4.173 | 4.017 | |
| Gemini-2.5-flashModel Type=General2026.05 | 3.967 | 3.912 | |
| CPCD-Chat-8BModel Type=Ours2026.05 | 3.884 | 3.846 | |
| PsyLLMModel Type=Domain-specific, Backbone=Qwen3-8B2026.05 | 3.825 | 3.768 | |
| CamelModel Type=Domain-specific, Backbone=LLaMA-8B2026.05 | 3.778 | 3.812 | |
| CPCD-Chat-4BModel Type=Ours2026.05 | 3.776 | 3.712 | |
| CBT-LLMModel Type=Domain-specific, Backbone=Baichuan-7B2026.05 | 3.714 | 3.678 | |
| Qwen3-8BModel Type=General2026.05 | 3.625 | 3.558 |