Video Question Answering on VNBench
77.88AccuracyBIMBA-LLaVA
Evaluation Results
| Method | Links | |
|---|---|---|
| BIMBA-LLaVALLM=Qwen2-7B, Frames=1282025.03 | 77.88 | |
| LLaVA-VideoLLM=Qwen2-7B, Frames=642025.03 | 70.77 | |
| Video Panels (LLaVA-OV 72B)#frames=32, Model Context Category=Medium-context VLMs2025.09 | 62.6 | |
| Video-XLLLM=Qwen2-7B, Frames=20482025.03 | 61.6 | |
| LongVULLM=Qwen2-7B, Frames=1fps2025.03 | 60.6 | |
| LLaVA-OV 72B#frames=32, Model Context Category=Medium-context VLMs2025.09 | 59.4 | |
| Video Panels (Qwen-2.5VL 7B)#frames=32, Model Context Category=Medium-context VLMs2025.09 | 58.5 | |
| Video Panels (LLaVA-OV 7B)#frames=32, Model Context Category=Medium-context VLMs2025.09 | 57.7 | |
| Qwen-2.5VL 7B#frames=32, Model Context Category=Medium-context VLMs2025.09 | 55.6 | |
| LLaVA-OV 7B#frames=32, Model Context Category=Medium-context VLMs2025.09 | 54.8 | |
| LLaVA-OneVisionLLM=Qwen2-7B, Frames=322025.03 | 51.8 | |
| LongVALLM=Qwen2-7B, Frames=1282025.03 | 41.5 | |
| Video Panels (LLaVA-OV 0.5B)#frames=32, Model Context Category=Medium-context VLMs2025.09 | 41 | |
| PLLAVALLM=Vicuna-7B, Frames=162025.03 | 40.2 | |
| LLaVA-OV 0.5B#frames=32, Model Context Category=Medium-context VLMs2025.09 | 39.8 | |
| Video Panels (Video-LLaVA 7B)#frames=8, Model Context Category=Small-context VLMs2025.09 | 32 | |
| Video Panels (VideoChat2-HD)#frames=16, Model Context Category=Small-context VLMs2025.09 | 28.5 | |
| VideoChat2-HD#frames=16, Model Context Category=Small-context VLMs2025.09 | 27.9 | |
| Video-LLaVA 7B#frames=8, Model Context Category=Small-context VLMs2025.09 | 27.8 | |
| Video-LLaMA2LLM=Qwen2-7B, Frames=322025.03 | 24.9 | |
| LLaVA-NeXT-VideoLLM=Vicuna-7B, Frames=322025.03 | 20.1 | |
| VideoChat2LLM=Vicuna-7B, Frames=162025.03 | 12.4 | |
| LLAMA-VIDLLM=Vicuna-7B, Frames=1fps2025.03 | 10.8 |