Audio-Video Understanding on AVSD (test)
62.8AccuracyQwen2.5-Omni
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-OmniModel Size=7-8B, Zero-shot evaluation=true2025.12 | 62.8 | |
| JavisGPTModel Size=7-8B, #Samples=1.5M, Zero-shot evaluation=true2025.12 | 62.2 | |
| VideoLLaMA2Model Size=7-8B, #Samples=1.9M, Zero-shot evaluation=true2025.12 | 57.2 | |
| VideoLLaMA2.1Model Size=7-8B, #Samples=1.9M, Zero-shot evaluation=true2025.12 | 57.2 | |
| AV-LLMModel Size=7-8B, Zero-shot evaluation=true2025.12 | 52.6 | |
| VideoLLaMAModel Size=7-8B, Zero-shot evaluation=true2025.12 | 36.7 | |
| Macaw-LLMModel Size=7-8B, Zero-shot evaluation=true2025.12 | 34.3 | |
| NExT-GPTModel Size=7-8B, #Samples=1.9M, Zero-shot evaluation=true2025.12 | 30.8 | |
| UnifiedIO-2Model Size=7-8B, #Samples=9.2B, Zero-shot evaluation=true2025.12 | 16.5 |