Video Understanding on Video-MME With Subtitles
75.8Performance (Short)LLaVA-OneVision
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LLaVA-OneVisionLLM Size=7B, Frames=322025.12 | 75.8 | 58.4 | 51.6 | 61.9 | |
| FlexPrefillBackbone=Qwen2.5-VL-7B-Instruct, Sparsity(↑)=36.3%, tau=0.1, gamma=0.992025.12 | 75.4 | 71.7 | 61.7 | 69.6 | |
| FlashAttentionBackbone=Qwen2.5-VL-7B-Instruct, Sparsity(↑)=0%2025.12 | 75.3 | 71.7 | 61.7 | 69.6 | |
| UniSparseBackbone=Qwen2.5-VL-7B-Instruct, Sparsity(↑)=47.2%, target_sparsity=0.952025.12 | 75.3 | 71.7 | 62 | 69.7 | |
| FlexPrefillBackbone=Qwen2.5-VL-7B-Instruct, Sparsity(↑)=66.3%, tau=0.1, gamma=0.952025.12 | 75.2 | 69.9 | 61.7 | 68.9 | |
| XAttentionBackbone=Qwen2.5-VL-7B-Instruct, Sparsity(↑)=50.4%, tau=0.952025.12 | 75.2 | 70.8 | 61.1 | 69 | |
| UniSparseBackbone=Qwen2.5-VL-7B-Instruct, Sparsity(↑)=58.6%, target_sparsity=0.92025.12 | 74.9 | 71.2 | 63.4 | 69.9 | |
| XAttentionBackbone=Qwen2.5-VL-7B-Instruct, Sparsity(↑)=61.1%, tau=0.92025.12 | 74 | 69.8 | 60.4 | 68.1 | |
| VideoScaffoldLLM Size=7B, Frames=602025.12 | 52.9 | 45.5 | 43.2 | 47.2 | |
| VideoChat2LLM Size=7B, Frames=162025.12 | 52.8 | 39.4 | 39.2 | 43.8 | |
| Chat-UniViLLM Size=7B, Frames=642025.12 | 51.2 | 44.6 | 41.8 | 45.9 | |
| Video-LLaVALLM Size=7B, Frames=82025.12 | 46.1 | 40.7 | 38.1 | 41.6 | |
| LLaVA-SFT + OursLLM Size=7B, Frames=602025.12 | 45.3 | 44.2 | 39.5 | 43 | |
| LLaVA-SFTLLM Size=7B, Frames=162025.12 | 42.6 | 42.3 | 37.9 | 40.9 |