Speech Emotion Recognition on MSP-Podcast
66.4UABLSP-Emo
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BLSP-EmoModel Type=Speech-LLM, Fine-tuned=true, Variant=52026.02 | 66.4 | — | |
| RE-LLM (w/o dim-emo. aux)Model Type=Ablation, Variant=72026.02 | 66.4 | — | |
| RE-LLM (w/o enc.)Model Type=Ablation, Variant=82026.02 | 66.1 | — | |
| RE-LLMModel Type=Speech-LLM, Variant=62026.02 | 64.3 | — | |
| BLSP-EmoModel Type=Speech-LLM, Fine-tuned=false, Variant=42026.02 | 57.4 | — | |
| ZS-Fuse (WavLM-Large + clap)Foundation Model=WavLM-Large, Audio-Language Model=clap2026.03 | 31.18 | — | |
| WavLM-Large + noneFoundation Model=WavLM-Large, Audio-Language Model=none2026.03 | 30.88 | — | |
| ZS-Fuse (WavLM-Large + reclap)Foundation Model=WavLM-Large, Audio-Language Model=reclap2026.03 | 30.46 | — | |
| ZS-Fuse (WavLM-Large + clsp)Foundation Model=WavLM-Large, Audio-Language Model=clsp2026.03 | 30.41 | — | |
| WavLM-Base+ + noneFoundation Model=WavLM-Base+, Audio-Language Model=none2026.03 | 29.55 | — | |
| ZS-Fuse (WavLM-Base+ + clsp)Foundation Model=WavLM-Base+, Audio-Language Model=clsp2026.03 | 29.46 | — | |
| ZS-Fuse (WavLM-Base+ + clap)Foundation Model=WavLM-Base+, Audio-Language Model=clap2026.03 | 29.45 | — | |
| ZS-Fuse (HuBERT-Base + clsp)Foundation Model=HuBERT-Base, Audio-Language Model=clsp2026.03 | 29.27 | — | |
| ZS-Fuse (HuBERT-Large + clsp)Foundation Model=HuBERT-Large, Audio-Language Model=clsp2026.03 | 28.95 | — | |
| ZS-Fuse (WavLM-Base+ + reclap)Foundation Model=WavLM-Base+, Audio-Language Model=reclap2026.03 | 28.62 | — | |
| HuBERT-Large + noneFoundation Model=HuBERT-Large, Audio-Language Model=none2026.03 | 27.75 | — | |
| ZS-Fuse (HuBERT-Large + clap)Foundation Model=HuBERT-Large, Audio-Language Model=clap2026.03 | 27.6 | — | |
| ZS-Fuse (HuBERT-Base + clap)Foundation Model=HuBERT-Base, Audio-Language Model=clap2026.03 | 27.55 | — | |
| HuBERT-Base + noneFoundation Model=HuBERT-Base, Audio-Language Model=none2026.03 | 27.23 | — | |
| ZS-Fuse (HuBERT-Large + reclap)Foundation Model=HuBERT-Large, Audio-Language Model=reclap2026.03 | 27.16 | — | |
| ZS-Fuse (HuBERT-Base + reclap)Foundation Model=HuBERT-Base, Audio-Language Model=reclap2026.03 | 26.75 | — | |
| Random2026.03 | 12.41 | — |