Speech Emotion Recognition on Emo-Emilia Zero-Shot v1 (test)
70.64Accuracy (ACC)Qwen2.5-Omni
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-OmniSemantic Modality=true, Acoustic Modality=false2026.01 | 70.64 | 68.03 | |
| Qwen2-AudioSemantic Modality=true, Acoustic Modality=false2026.01 | 69.64 | 68.81 | |
| C2SERSemantic Modality=true, Acoustic Modality=true2026.01 | 68.29 | 61.28 | |
| Emotion2VecSemantic Modality=false, Acoustic Modality=false2026.01 | 52.79 | 50.44 | |
| FASSemantic Modality=true, Acoustic Modality=true2026.01 | 51.14 | 42.92 | |
| WhisperSemantic Modality=true, Acoustic Modality=false2026.01 | 50.5 | 42.29 | |
| WavLMSemantic Modality=true, Acoustic Modality=true2026.01 | 35.64 | 29.33 | |
| HuBERTSemantic Modality=true, Acoustic Modality=true2026.01 | 34.36 | 29.95 | |
| CLAPSemantic Modality=true, Acoustic Modality=false2026.01 | 24.93 | 18.83 | |
| MingTok-AudioSemantic Modality=false, Acoustic Modality=true2026.01 | 21.07 | 16.34 | |
| wav2vec 2.0Semantic Modality=true, Acoustic Modality=true2026.01 | 19.64 | 16.02 | |
| VibevoiceSemantic Modality=false, Acoustic Modality=true2026.01 | 19.36 | 15.35 | |
| EnCodecSemantic Modality=false, Acoustic Modality=true2026.01 | 15.64 | 11.47 |