Video Understanding Reasoning on VideoMME Long
81.8AccuracySTD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| STDBackbone=Qwen2-VL-7B-Instruct2025.05 | 81.8 | 1.7 | |
| SiLVRVisual Captioner=NVILA-7B, LLM=DeepSeek-R12025.05 | 62.7 | — | |
| StreamingBackbone=Qwen2-VL-7B-Instruct2025.05 | 59.6 | 1.36 | |
| VCAVisual Captioner=GPT-4o, LLM=GPT-4o2025.05 | 56.3 | — | |
| VideoTreeVisual Captioner=LLaVA1.6-7B, LLM=GPT-4o2025.05 | 54.2 | — | |
| STDBackbone=LLaVA-OneVision-7B2025.05 | 52.9 | 1.59 | |
| DrVideoVisual Captioner=LLaVA-NeXT, LLM=GPT-42025.05 | 51.7 | — | |
| VideoAgentVisual Captioner=CogAgent, LLM=GPT-42025.05 | 46.4 | — | |
| StreamingBackbone=LLaVA-OneVision-7B2025.05 | 36.2 | 1.45 | |
| LayerSkipBackbone=Qwen2-VL-7B-Instruct2025.05 | 5.7 | 0.55 | |
| LayerSkipBackbone=LLaVA-OneVision-7B2025.05 | 4.8 | 0.44 |