Speech Emotion Recognition on MELD In-Domain v1 (test)
54.06AccuracyQwen2.5-Omni
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-OmniSemantic Modality=true, Acoustic Modality=false2026.01 | 54.06 | 36.05 | |
| FASSemantic Modality=true, Acoustic Modality=true2026.01 | 51.89 | 48.42 | |
| C2SERSemantic Modality=true, Acoustic Modality=true2026.01 | 51.39 | 27.45 | |
| WhisperSemantic Modality=true, Acoustic Modality=false2026.01 | 49.59 | 43.62 | |
| HuBERTSemantic Modality=true, Acoustic Modality=true2026.01 | 45.99 | 38.07 | |
| Emotion2VecSemantic Modality=false, Acoustic Modality=false2026.01 | 45.04 | 45.49 | |
| WavLMSemantic Modality=true, Acoustic Modality=true2026.01 | 44.64 | 34.09 | |
| CLAPSemantic Modality=true, Acoustic Modality=false2026.01 | 43.74 | 34.96 | |
| MingTok-AudioSemantic Modality=false, Acoustic Modality=true2026.01 | 41.94 | 29.76 | |
| VibevoiceSemantic Modality=false, Acoustic Modality=true2026.01 | 39.06 | 30.43 | |
| wav2vec 2.0Semantic Modality=true, Acoustic Modality=true2026.01 | 37.44 | 28.36 | |
| Qwen2-AudioSemantic Modality=true, Acoustic Modality=false2026.01 | 35.29 | 29.91 | |
| EnCodecSemantic Modality=false, Acoustic Modality=true2026.01 | 34.38 | 29.41 | |
| VesperSemantic Modality=false, Acoustic Modality=false2026.01 | 25 | 45.7 |