Video Understanding on Perception zero-shot
72.8AccuracyVideoLLaMA3
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoLLaMA3LLM=Qwen2.5-7B, Frames=1fps2025.07 | 72.8 | |
| Qwen2.5-VLLLM=Qwen2.5-7B2025.07 | 70.5 | |
| InternVL3.5-REGATELLM=Qwen3-14B, Frames=16, Tokens=2.32B (↓ 41.41%)2025.07 | 66.7 | |
| InternVL3.5LLM=Qwen3-14B, Frames=16, Tokens=3.96B2025.07 | 65.3 | |
| LLaVA-NeXT-VideoLLM=Qwen2-32B, Frames=322025.07 | 59.4 | |
| LLaVA-OneVisionLLM=Qwen2-7B, Frames=322025.07 | 57.1 | |
| VideoLLaMA2-REGATELLM=Qwen2-7B, Frames=16, Tokens=49.27M (↓ 41.22%)2025.07 | 54.1 | |
| VILA1.5LLM=Llama-2-40B, Frames=82025.07 | 54 | |
| VideoLLaMA2LLM=Qwen2-7B, Frames=16, Tokens=83.82M2025.07 | 53 | |
| VideoChat2-REGATELLM=Mistral-7B, Frames=16, Tokens=2.22B (↓ 43.51%)2025.07 | 50 | |
| LLaVA-NeXT-VideoLLM=Vicuna-7B, Frames=322025.07 | 48.8 | |
| VideoChat2LLM=Mistral-7B, Frames=16, Tokens=3.93B2025.07 | 48.4 | |
| LLaMA-VIDLLM=Llama-2-7B, Frames=1fps2025.07 | 44.6 | |
| Video-LLaVALLM=Vicuna-7B, Frames=82025.07 | 44.3 |