Conversational Speech Emotion Recognition on IEMOCAP (Leave-One-Session-Out)
85.21Weighted Accuracy (WA)Audio Flamingo 3 + Titans+LoRA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Audio Flamingo 3 + Titans+LoRABackbone=Audio Flamingo 3, Adapter=Titans+LoRA2026.06 | 85.21 | 85.37 | 85.2 | |
| Audio Flamingo 3 + LoRABackbone=Audio Flamingo 3, Adapter=LoRA2026.06 | 84.59 | 85.02 | 84.57 | |
| Qwen2-Audio + Titans+LoRABackbone=Qwen2-Audio, Adapter=Titans+LoRA2026.06 | 83.66 | 84.2 | 83.67 | |
| Qwen2-Audio + LoRABackbone=Qwen2-Audio, Adapter=LoRA2026.06 | 82.4 | 82.61 | 82.42 | |
| Audio Flamingo 3Backbone=Audio Flamingo 3, Adapter=None2026.06 | 76.57 | 76.45 | 76.31 | |
| Ultravox-v0.4 + Titans+LoRABackbone=Ultravox-v0.4, Adapter=Titans+LoRA2026.06 | 65.49 | 65.43 | 65.61 | |
| Ultravox-v0.4 + LoRABackbone=Ultravox-v0.4, Adapter=LoRA2026.06 | 63.89 | 62.84 | 63.78 | |
| Qwen2-AudioBackbone=Qwen2-Audio, Adapter=None2026.06 | 58.92 | 59.82 | 58.25 | |
| Ultravox-v0.4Backbone=Ultravox-v0.4, Adapter=None2026.06 | 45.29 | 47.09 | 44.53 |