Speech Emotion Recognition on IEMOCAP (test)
80.98AccuracyOurs (Sys. 10)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Ours (Sys. 10)SED=true, Domain SFT=true, Confidence Score Data Selection=90%, RL-based SED Rectification=true2026.06 | 80.98 | — | — | — | |
| VIB-Emo2026.06 | 77.6 | — | — | — | |
| BLSP-Emo2026.06 | 75.99 | — | — | — | |
| HuBERT X-Large (Jiao)Base Model=HuBERT X-Large, Reference=Jiao et al. (2024)2026.02 | 74.57 | — | — | 74.24 | |
| ENTCore Mechanism=Efficient Transformer, Params (M)=8.55, Energy (mJ)=6.352026.02 | 73.88 | — | — | 72.43 | |
| PTS-SNNCore Mechanism=Spiking Prompt, Params (M)=1.19, Energy (mJ)=0.352026.02 | 73.72 | — | — | 73.34 | |
| DSTCore Mechanism=Dual-Stream Fusion, Params (M)=22.78, Energy (mJ)=35.342026.02 | 73.6 | — | — | 71.8 | |
| Whisper Large V3Base Model=Whisper Large V3, Reference=Ma et al. (2024)2026.02 | 73.54 | — | — | 72.86 | |
| Whisper Small (QKV Pooling)Base Model=Whisper Small, Pooling=Multi-head QKV Pooling2026.02 | 72.96 | — | — | 71.98 | |
| ShiftFormerCore Mechanism=Sparse Shift, Params (M)=9.50, Energy (mJ)=16.202026.02 | 72.7 | — | — | 72.1 | |
| MSTRCore Mechanism=Multi-Scale Transformer, Params (M)=30.03, Energy (mJ)=51.062026.02 | 71.6 | — | — | 70.6 | |
| HuBERT X-Large (Jin)Base Model=HuBERT X-Large, Reference=Jin et al. (2025)2026.02 | 71.46 | — | — | 70.65 | |
| Co-attentionCore Mechanism=Cross-Attention, Params (M)=175.30, Energy (mJ)=103.402026.02 | 71.05 | — | — | 69.8 | |
| WavLM LargeBase Model=WavLM Large, Reference=Ma et al. (2024)2026.02 | 69.47 | — | — | 69.07 | |
| Audio-Flamingo-32026.06 | 69.06 | — | — | — | |
| VQ-MAE-S-12Masking Strategy=Frame, Query2Emo=true2023.04 | 66.4 | 65.8 | — | — | |
| VQ-MAE-S-12Masking Strategy=Frame, Query2Emo=false2023.04 | 65.2 | 64.9 | — | — | |
| HuBERT LargeBase Model=HuBERT Large, Reference=Ma et al. (2024)2026.02 | 63.87 | — | — | 63.1 | |
| VQ-MAE-S-12Masking Strategy=Patch-tf, Query2Emo=true2023.04 | 63.1 | 62.5 | — | — | |
| VQ-MAE-S-12Masking Strategy=Patch-tf, Query2Emo=false2023.04 | 61.9 | 61.2 | — | — | |
| MAE-ASTMasking Strategy=Patch-tf2023.04 | 58.6 | — | — | — | |
| Kimi-Audio2026.06 | 57.72 | — | — | — | |
| Data2vec 2.0 LargeBase Model=Data2vec 2.0 Large, Reference=Ma et al. (2024)2026.02 | 57.3 | — | — | 56.23 | |
| SSASTMasking Strategy=Patch-tf2023.04 | 54.3 | — | — | — | |
| Step-Audio-R12026.06 | 53.99 | — | — | — | |
| SpecMAE-12Masking Strategy=Patch-tf2023.04 | 46.7 | 45.9 | — | — | |
| OSUM-EChat2026.06 | 41.49 | — | — | — | |
| Qwen2-Audio2026.06 | 37.71 | — | — | — | |
| HumanOmniV2-7Bmode=zero-shot2026.02 | — | — | 62.74 | — | |
| OmniSapiens-7B 2.0mode=zero-shot2026.02 | — | — | 72.11 | — | |
| OmniSapiens-7B RLmode=zero-shot2026.02 | — | — | 55.77 | — | |
| Qwen 2.5-Omni-7Bmode=zero-shot2026.02 | — | — | 53.53 | — |