Temporal-causal reasoning on CPCD-Bench
4.525LLM-as-a-Judge ScoreGPT-5.4
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5.4Model Type=General2026.05 | 4.525 | 4.569 | |
| DeepSeek V3.2Model Type=General2026.05 | 4.488 | 4.413 | |
| Gemini-3-flash-previewModel Type=General2026.05 | 4.445 | 4.412 | |
| GLM-5.1Model Type=General2026.05 | 4.311 | 4.288 | |
| Qwen3-MaxModel Type=General2026.05 | 4.238 | 4.123 | |
| Kimi-k2.5Model Type=General2026.05 | 4.228 | 4.189 | |
| MiniMax M2.7Model Type=General2026.05 | 4.212 | 4.188 | |
| Gemini-2.5-flashModel Type=General2026.05 | 4.211 | 4.189 | |
| CPCD-Chat-8BModel Type=Ours2026.05 | 3.824 | 3.812 | |
| PsyLLMModel Type=Domain-specific, Backbone=Qwen3-8B2026.05 | 3.823 | 3.965 | |
| CBT-LLMModel Type=Domain-specific, Backbone=Baichuan-7B2026.05 | 3.733 | 3.658 | |
| CamelModel Type=Domain-specific, Backbone=LLaMA-8B2026.05 | 3.712 | 3.755 | |
| CPCD-Chat-4BModel Type=Ours2026.05 | 3.641 | 3.612 | |
| Qwen3-8BModel Type=General2026.05 | 3.623 | 3.789 |