Speech Emotion Recognition on IEMOCAP (UA, WA, F1)
83.91UAPL-Distill
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PL-DistillType=Student Models2026.02 | 83.91 | 82.12 | 82.62 | |
| LLaVA-KDType=Student Models2026.02 | 81.56 | 80.28 | 80.49 | |
| Forward KLType=Student Models2026.02 | 79.33 | 76.77 | 77.22 | |
| Reverse KLType=Student Models2026.02 | 79.32 | 78.34 | 78.76 | |
| SFTType=Student Models2026.02 | 77.59 | 76.04 | 76.29 | |
| RE-LLMModel Type=Speech-LLM, Variant=62026.02 | 76.6 | — | — | |
| RE-LLM (w/o dim-emo. aux)Model Type=Ablation, Variant=72026.02 | 74.5 | — | — | |
| Whisper large v3Type=Pretrained Models2026.02 | 73.54 | 72.86 | 73.11 | |
| RE-LLM (w/o enc.)Model Type=Ablation, Variant=82026.02 | 72.9 | — | — | |
| BLSP-EmoModel Type=Speech-LLM, Fine-tuned=true, Variant=52026.02 | 72.8 | — | — | |
| BLSP-EmoModel Type=Speech-LLM, Fine-tuned=false, Variant=42026.02 | 71.2 | — | — | |
| WavLM largeType=Pretrained Models2026.02 | 69.47 | 69.07 | 69.29 | |
| Qwen2-AudioType=Teacher Model2026.02 | 64.33 | 60.37 | 61.61 | |
| data2vec 2.0 largeType=Pretrained Models2026.02 | 57.3 | 56.23 | 56.7 |