Speech Emotion Recognition on RAVDESS In-Domain v1 (test)
85.74AccuracyQwen2-Audio
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2-AudioSemantic Modality=true, Acoustic Modality=false2026.01 | 85.74 | 86.59 | |
| FASSemantic Modality=true, Acoustic Modality=true2026.01 | 76.61 | 76.19 | |
| Qwen2.5-OmniSemantic Modality=true, Acoustic Modality=false2026.01 | 75.35 | 74.98 | |
| Emotion2VecSemantic Modality=false, Acoustic Modality=false2026.01 | 70.06 | 68.84 | |
| HuBERTSemantic Modality=true, Acoustic Modality=true2026.01 | 69.96 | 68.79 | |
| WhisperSemantic Modality=true, Acoustic Modality=false2026.01 | 62.3 | 60.61 | |
| WavLMSemantic Modality=true, Acoustic Modality=true2026.01 | 61.9 | 60.69 | |
| CLAPSemantic Modality=true, Acoustic Modality=false2026.01 | 47.38 | 44.83 | |
| VibevoiceSemantic Modality=false, Acoustic Modality=true2026.01 | 37.9 | 31.48 | |
| MingTok-AudioSemantic Modality=false, Acoustic Modality=true2026.01 | 36.49 | 26.12 | |
| wav2vec 2.0Semantic Modality=true, Acoustic Modality=true2026.01 | 23.59 | 16.44 | |
| EnCodecSemantic Modality=false, Acoustic Modality=true2026.01 | 22.78 | 18.44 |