Symptom Detection on Psychotherapy dialogue datasets
79.73AccuracyGPT-4
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GPT-4Model Category=Closed-Source Models2024.10 | 79.73 | 78.52 | 71.21 | 74.69 | 78.89 | 79.56 | |
| GPT-4-turboModel Category=Closed-Source Models2024.10 | 75.61 | 87.26 | 49.13 | 62.85 | 72.34 | 73.86 | |
| Qwen2-72BModel Category=Open-Source Models2024.10 | 73.85 | 74.05 | 58.15 | 65.13 | 72.1 | 73.22 | |
| Llama3.1-70BModel Category=Open-Source Models2024.10 | 73.33 | 72.01 | 59.74 | 65.29 | 71.82 | 72.86 | |
| Llama3.1-405BModel Category=Open-Source Models2024.10 | 72.91 | 69.6 | 63.06 | 66.16 | 71.79 | 72.69 | |
| Mistral-8X22BModel Category=Open-Source Models2024.10 | 62.15 | 54.05 | 66.16 | 59.48 | 61.98 | 62.38 | |
| Mistral-8X7BModel Category=Open-Source Models2024.10 | 60.7 | 61.58 | 17.1 | 26.72 | 49.93 | 53.64 | |
| GPT-4o-miniModel Category=Closed-Source Models2024.10 | 49.15 | 44.67 | 88.24 | 59.31 | 45.76 | 43.59 |