Discrimination on PsyCLIENT-CP vanilla
83.1Accuracy (A)Claude-Sonet-3.5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Claude-Sonet-3.5LLM-as-a-judge=true2026.01 | 83.1 | 0.622 | |
| DeepSeek-R1LLM-as-a-judge=true2026.01 | 27.8 | 0.158 | |
| Qwen3-235B-A22BLLM-as-a-judge=true2026.01 | 10.8 | 0.111 | |
| DeepSeek-V3-0324LLM-as-a-judge=true2026.01 | 7.2 | 0.039 | |
| GPT-4oLLM-as-a-judge=true2026.01 | 5 | 0.072 | |
| Qwen2.5-72B-InstructLLM-as-a-judge=true2026.01 | 1.4 | 0.008 |