Counseling Quality on MESC
50ComprehensivenessDELTA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DELTAPrompting Strategy=DELTA Framework, Base Model=GPT-5.22026.02 | 50 | 92.53 | 91.11 | 100 | 83.41 | |
| DELTAPrompting Strategy=DELTA Framework, Base Model=GPT-4o2026.02 | 48.62 | 79.56 | 76.92 | 100 | 76.28 | |
| GPT-5.2Prompting Strategy=Direct Prompting (DP), Base Model=GPT-5.22026.02 | 47.5 | 86.75 | 86.03 | 100 | 80.07 | |
| DELTAPrompting Strategy=DELTA Framework, Base Model=Qwen3 (8B)2026.02 | 47.43 | 80.1 | 76.05 | 100 | 75.89 | |
| Qwen3 (8B)Prompting Strategy=Direct Prompting (DP), Base Model=Qwen3 (8B)2026.02 | 46.68 | 75.99 | 70.61 | 100 | 73.32 | |
| DELTAPrompting Strategy=DELTA Framework, Base Model=Llama 3.1 (8B)2026.02 | 46.12 | 72.33 | 68.28 | 99.03 | 71.44 | |
| GPT-4oPrompting Strategy=Direct Prompting (DP), Base Model=GPT-4o2026.02 | 45.92 | 75.15 | 73.1 | 100 | 73.54 | |
| Llama 3.1 (8B)Prompting Strategy=Direct Prompting (DP), Base Model=Llama 3.1 (8B)2026.02 | 45.57 | 71.12 | 66.99 | 99.03 | 70.68 | |
| DELTAPrompting Strategy=DELTA Framework, Base Model=Mistral (7B)2026.02 | 41.75 | 71.36 | 66.34 | 99.03 | 69.62 | |
| Mistral (7B)Prompting Strategy=Direct Prompting (DP), Base Model=Mistral (7B)2026.02 | 37.38 | 64.08 | 62.78 | 100 | 66.06 | |
| DELTAPrompting Strategy=DELTA Framework, Base Model=Hunyuan (7B)2026.02 | 34.95 | 66.5 | 64.08 | 100 | 66.38 | |
| Hunyuan (7B)Prompting Strategy=Direct Prompting (DP), Base Model=Hunyuan (7B)2026.02 | 26.7 | 56.07 | 57.28 | 100 | 60.01 | |
| MESCDescription=Original MESC evaluation results2026.02 | 8.71 | 29.1 | 32.5 | 88.56 | 39.72 |