Video Understanding on VideoMME (Score %)
75Score (%)Gemini-1.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-1.5-Pro#Params.=-2026.06 | 75 | |
| GPT-4o#Params.=-2026.06 | 71.9 | |
| Gemini-1.5-Flash#Params.=-2026.06 | 70.3 | |
| Vega#Params.=3B2026.06 | 69.4 | |
| Ouro-Spatial-8BModel scale=8B, Number of uniformly sampled frames=322026.06 | 66.5 | |
| VideoLLaMA3#Params.=7B2026.06 | 66.2 | |
| Qwen3-VL-8BModel scale=8B, Number of uniformly sampled frames=322026.06 | 65.5 | |
| Qwen2.5-VLScale=7B2026.06 | 65.1 | |
| Ouro-Spatial-4BModel scale=4B, Number of uniformly sampled frames=322026.06 | 63.9 | |
| ProtoKVBudget |M|=6K, Backbone=Qwen2-VL-7B2026.06 | 63.7 | |
| LLaVA-Video#Params.=7B2026.06 | 63.3 | |
| Qwen3-VL-4BModel scale=4B, Number of uniformly sampled frames=322026.06 | 62.9 | |
| InfiniPot-VBudget |M|=6K, Backbone=Qwen2-VL-7B2026.06 | 62.8 | |
| MOSS-Video-PreviewSFT Mode=real-time2026.06 | 62.48 | |
| ProtoKVBudget |M|=3K, Backbone=Qwen2-VL-7B2026.06 | 62.1 | |
| InfiniPot-VBudget |M|=3K, Backbone=Qwen2-VL-7B2026.06 | 61.2 | |
| MOSS-Video-PreviewSFT Mode=offline2026.06 | 59.81 | |
| DyCokeBudget |M|=6K, Backbone=Qwen2-VL-7B2026.06 | 59.7 | |
| LLaVA-OV#Params.=7B2026.06 | 58.2 | |
| Show-o2#Params.=7B2026.06 | 57.4 | |
| GPT-4V#Params.=-2026.06 | 57 | |
| LLaDA-V+OursAttention=Block Approximate Sparse Attention2026.05 | 56.56 | |
| LLaDA-VAttention=Full-Attention2026.05 | 56.07 | |
| LLaDA-V+XAttAttention=XAtt2026.05 | 55.63 | |
| DyCokeBudget |M|=3K, Backbone=Qwen2-VL-7B2026.06 | 55.3 | |
| LongVA#Params.=7B2026.06 | 52.6 | |
| LLaDA-V+FlexAttention=Flex2026.05 | 48.22 | |
| VideoLLaMA2#Params.=7B2026.06 | 47.9 |