Audio-Video Understanding on MU-AVQA (test)
82.1AccuracyJavisGPT
Evaluation Results
| Method | Links | |
|---|---|---|
| JavisGPTModel Size=7-8B, #Samples=1.5M, Zero-shot evaluation=true2025.12 | 82.1 | |
| VideoLLaMA2.1Model Size=7-8B, #Samples=1.9M, Zero-shot evaluation=true2025.12 | 80.9 | |
| Qwen2.5-OmniModel Size=7-8B, Zero-shot evaluation=true2025.12 | 79.9 | |
| VideoLLaMA2Model Size=7-8B, #Samples=1.9M, Zero-shot evaluation=true2025.12 | 79.2 | |
| AV-LLMModel Size=7-8B, Zero-shot evaluation=true2025.12 | 45.2 | |
| VideoLLaMAModel Size=7-8B, Zero-shot evaluation=true2025.12 | 36.6 | |
| UnifiedIO-2Model Size=7-8B, #Samples=9.2B, Zero-shot evaluation=true2025.12 | 34.1 | |
| Macaw-LLMModel Size=7-8B, Zero-shot evaluation=true2025.12 | 31.8 | |
| NExT-GPTModel Size=7-8B, #Samples=1.9M, Zero-shot evaluation=true2025.12 | 19.3 |