Fine-grained Multimodal Emotion Recognition on OV-MERD+
65.13WAFAffectAgent
Evaluation Results
| Method | Links | |
|---|---|---|
| AffectAgentModality=A, V, T, Backbone=AffectGPT2026.04 | 65.13 | |
| AffectGPTModality=A, V, T2026.04 | 62.52 | |
| AffectAgentModality=A, V, T, Backbone=Emotion-LLaMA2026.04 | 57.72 | |
| Emotion-LLaMAModality=A, V, T2026.04 | 52.97 | |
| VEENABackbone=Qwen3-VL-4B-Instruct2026.05 | 49.67 | |
| PAIBackbone=Qwen3-VL-4B-Instruct2026.05 | 46.32 | |
| AffectAgentModality=A, V, T, Backbone=PandaGPT2026.04 | 43.67 | |
| VISTABackbone=Qwen3-VL-4B-Instruct2026.05 | 40.82 | |
| BaselineBackbone=Qwen3-VL-4B-Instruct2026.05 | 40.42 | |
| PandaGPTModality=A, V, T2026.04 | 37.12 | |
| AffectAgentModality=A, V, T, Backbone=Video-LLaMA 22026.04 | 24.44 | |
| AffectAgentModality=A, V, T, Backbone=ChatBridge2026.04 | 23.8 | |
| AffectAgentModality=A, V, T, Backbone=Video-LLaMA2026.04 | 22.65 | |
| AffectAgentModality=A, V, T, Backbone=VideoChat2026.04 | 22.36 | |
| Video-LLaMA 2Modality=A, V, T2026.04 | 16.58 | |
| ChatBridgeModality=A, V, T2026.04 | 15.35 | |
| VideoChatModality=A, V, T2026.04 | 15.02 | |
| Video-LLaMAModality=A, V, T2026.04 | 13.98 |