Speech Emotion Recognition on IEMOCAP Speaker-independent 5-fold cross-validation
78.47WAProposed Method
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Proposed MethodModality=Audio-only2025.12 | 78.47 | 79.14 | |
| Kang et al. [8]Modality=Audio-only2025.12 | 75.37 | 76.04 | |
| Wang et al. [25]Modality=Multi-modal2025.12 | 75.2 | 76.4 | |
| Gao et al. [23]Modality=Audio-only2025.12 | 74.94 | 76.1 | |
| He et al. [24]Modality=Multi-modal2025.12 | 74.5 | 75 | |
| HuBERT Large + Ours (TAP)Backbone=HuBERT Large, Strategy=Train all parameters (TAP)2022.02 | 74.2 | — | |
| HuBERT Large + Ours (SNP)Backbone=HuBERT Large, Strategy=Speaker normalization projector (SNP)2022.02 | 73.9 | — | |
| He et al. [22]Modality=Audio-only2025.12 | 73.8 | 74.25 | |
| Wang et al. [21]Modality=Audio-only2025.12 | 73.37 | 74.18 | |
| Sun et al. [20]Modality=Audio-only2025.12 | 72.86 | 72.85 | |
| HuBERT LargeBackbone=HuBERT Large2022.02 | 71.9 | — | |
| AttPool2022.02 | 71.7 | — | |
| Tang et al. [19]Modality=Audio-only2025.12 | 71.64 | 72.72 | |
| HuBERT Base + Ours (TAP)Backbone=HuBERT Base, Strategy=Train all parameters (TAP)2022.02 | 69.9 | — | |
| ACTC2022.02 | 69 | — | |
| HuBERT Base + Ours (SNP)Backbone=HuBERT Base, Strategy=Speaker normalization projector (SNP)2022.02 | 69 | — | |
| HuBERT BaseBackbone=HuBERT Base2022.02 | 68.9 | — | |
| wav2vec2-PT2022.02 | 67.2 | — | |
| WISE2022.02 | 66.5 | — |