Speech Emotion Recognition on IEMOCAP (Accuracy)
79.01AccuracyQwen2.5-Omni-7B + CoAT
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-Omni-7B + CoATBackbone=Qwen2.5-Omni-7B, Method=CoAT2026.06 | 79.01 | |
| BLSP-Emo2026.04 | 76 | |
| FreezeEmpath2026.04 | 76 | |
| C²SER2026.04 | 73.5 | |
| Qwen2-Audio + CoATBackbone=Qwen2-Audio, Method=CoAT2026.06 | 72.7 | |
| Audio Flamingo 3 + CoATBackbone=Audio Flamingo 3, Method=CoAT2026.06 | 70.39 | |
| VQ-MAE-S frameworkMethodology=VQ-MAE-S framework2026.05 | 66.4 | |
| Dual-Path (SNN + CNN)Methodology=Dual-Path (SNN + CNN)2026.05 | 65.3 | |
| Qwen2-Audio2026.04 | 64.6 | |
| Audio Flamingo 3Backbone=Audio Flamingo 3, Method=Baseline2026.06 | 63.58 | |
| Kimi-Audio2026.04 | 61.3 | |
| Qwen2.5-Omni-7BBackbone=Qwen2.5-Omni-7B, Method=Baseline2026.06 | 55.22 | |
| Qwen2-AudioBackbone=Qwen2-Audio, Method=Baseline2026.06 | 54 |