Audio-Visual Question Answering on General AVQA Benchmarks (AVQA, VALOR2, MUSIC-AVQA)
81.58Accuracy (MUSIC-AVQA)VideoLLaMA2-AVCD
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VideoLLaMA2-AVCDBackbone=VideoLLaMA2-AVCD2026.05 | 81.58 | — | — | — | |
| VideoLLaMA2.1-7B-AVBackbone=VideoLLaMA2.1-7B-AV2026.05 | 79.32 | 85.69 | 60.57 | 68.65 | |
| SFFLBackbone=Qwen3-Omni-30B-A3B-Instruct2026.05 | 69.93 | 92.31 | 77.43 | 80.24 | |
| PEM-AVQA-14K DATA (GRPO)Backbone=Qwen3-Omni-30B-A3B-Instruct, Protocol=GRPO Training2026.05 | 66.61 | 91.31 | 76.35 | 77.53 | |
| Zero-Shot InferenceBackbone=Qwen3-Omni-30B-A3B-Instruct2026.05 | 66 | 89.62 | 76.56 | 76.33 | |
| Qwen3-Omni-ThinkingBackbone=Qwen3-Omni-Thinking2026.05 | 63.64 | 90.79 | 75.59 | 76.49 | |
| Video-SALMONN-2+(7B)Backbone=Video-SALMONN-2+(7B)2026.05 | 63.41 | 80.69 | 61.43 | 66.37 | |
| SFFLBackbone=Qwen2.5-Omni-7B2026.05 | 62.71 | 88.67 | 70.59 | 71.69 | |
| Zero-Shot InferenceBackbone=Qwen2.5-Omni-7B2026.05 | 58.82 | 88.07 | 66.36 | 69.14 | |
| Gemini-3-FlashBackbone=Gemini-3-Flash2026.05 | 58.81 | 89.34 | 72.67 | 73.27 |