Semantic Fidelity Evaluation on User Fidelity Experiment Dataset
4.49Emotion Fidelity Score (Emo)CogWM-14B
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| CogWM-14BParameter Count=14B, Training Mode=Joint Optimization2026.06 | 4.49 | 4.16 | 4.33 | 4.75 | 3.32 | 4.5 | |
| Qwen3-14BParameter Count=14B2026.06 | 2.37 | 1.79 | 2.06 | 1.82 | 2.41 | 4.45 | |
| GPT-5.52026.06 | 2.34 | 1.9 | 2.09 | 1.74 | 2.62 | 4.71 | |
| utt-only-14BParameter Count=14B, Training Mode=Utterance-only fine-tuning2026.06 | 2.22 | 1.24 | 1.17 | 1.31 | 1.13 | 2.43 | |
| DS-V4-Pro2026.06 | 2.13 | 1.87 | 2.21 | 1.93 | 2.73 | 4.57 | |
| Dual-LLMBackbone=GPT-5.52026.06 | 2.13 | 1.84 | 2.27 | 1.95 | 2.67 | 4.49 |