Client experience assessment on Client experience assessment dataset (test)
0.76SOHuman High Quality (HQ)
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Human High Quality (HQ)Type=Human Baseline2025.02 | 0.76 | 0.78 | 4.21 | 5.13 | 4.67 | 4.01 | |
| CAMIBackbone=GPT-4o2025.02 | 0.72 | 0.75 | 3.63 | 4.82 | 4.43 | 3.71 | |
| CAMI-TEBackbone=GPT-4o2025.02 | 0.69 | 0.71 | 3.42 | 4.47 | 4.35 | 3.63 | |
| CoSBackbone=GPT-4o2025.02 | 0.68 | 0.71 | 3.37 | 4.42 | 4.31 | 3.6 | |
| CAMIBackbone=Llama-3.1 70B2025.02 | 0.68 | 0.68 | 3.47 | 3.88 | 3.97 | 3.66 | |
| BaseBackbone=GPT-4o2025.02 | 0.66 | 0.69 | 3.26 | 4.33 | 4.3 | 3.47 | |
| DIIRBackbone=GPT-4o2025.02 | 0.65 | 0.68 | 3.32 | 4.17 | 4.13 | 3.48 | |
| CoSBackbone=Llama-3.1 70B2025.02 | 0.63 | 0.63 | 3.08 | 3.4 | 3.84 | 3.23 | |
| DIIRBackbone=Llama-3.1 70B2025.02 | 0.61 | 0.57 | 3.02 | 3.08 | 3.37 | 3.18 | |
| CAMI-TEBackbone=Llama-3.1 70B2025.02 | 0.61 | 0.59 | 3.09 | 3.13 | 3.49 | 3.23 | |
| BaseBackbone=Llama-3.1 70B2025.02 | 0.58 | 0.61 | 2.93 | 3.24 | 3.71 | 3.12 | |
| Human Low Quality (LQ)Type=Human Baseline2025.02 | 0.41 | 0.48 | 3.43 | 3.11 | 3.6 | 3.63 |