Speech Emotion Recognition on ESD In-Domain v1 (test)
93.86ACCC2SER
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| C2SERSemantic Modality=true, Acoustic Modality=true2026.01 | 93.86 | 68.19 | |
| FASSemantic Modality=true, Acoustic Modality=true2026.01 | 87.27 | 86.72 | |
| WhisperSemantic Modality=true, Acoustic Modality=false2026.01 | 84.53 | 83.92 | |
| HuBERTSemantic Modality=true, Acoustic Modality=true2026.01 | 80.1 | 79.13 | |
| WavLMSemantic Modality=true, Acoustic Modality=true2026.01 | 77.43 | 76.63 | |
| CLAPSemantic Modality=true, Acoustic Modality=false2026.01 | 59.97 | 59.4 | |
| Qwen2.5-OmniSemantic Modality=true, Acoustic Modality=false2026.01 | 51.6 | 35.7 | |
| Emotion2VecSemantic Modality=false, Acoustic Modality=false2026.01 | 51.39 | 50.87 | |
| VibevoiceSemantic Modality=false, Acoustic Modality=true2026.01 | 37.61 | 36.4 | |
| Qwen2-AudioSemantic Modality=true, Acoustic Modality=false2026.01 | 36.99 | 23.35 | |
| MingTok-AudioSemantic Modality=false, Acoustic Modality=true2026.01 | 29.93 | 28.8 | |
| EnCodecSemantic Modality=false, Acoustic Modality=true2026.01 | 28.73 | 25.18 | |
| wav2vec 2.0Semantic Modality=true, Acoustic Modality=true2026.01 | 21.81 | 19.57 |