Video Understanding on Video-MME (Short, Medium, Long, Overall)
76.3Score (Overall)video-SALMONN-R3
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| video-SALMONN-R3Localization Approach=Single-model localization2026.06 | 76.3 | 83.2 | 78.6 | 67.2 | |
| VideoLucyLocalization Approach=Multi-agent localization2026.06 | 72.5 | 78.6 | 72.1 | 66.8 | |
| GCAgentLocalization Approach=Multi-agent localization2026.06 | 71.9 | 72.6 | 69.8 | 73.4 | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 69.8 | — | — | 59.6 | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 69.6 | — | — | 59.4 | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 68.6 | — | — | 59 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 67.9 | — | — | 57.2 | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 67.7 | — | — | 57.3 | |
| Qwen3-VL-8BFrames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 67.6 | — | — | 56.9 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 67.3 | — | — | 56.8 | |
| VideoChat-R1.5Localization Approach=Single-model localization2026.06 | 67.1 | — | — | — | |
| LongVTLocalization Approach=Single-model localization2026.06 | 67 | — | — | — | |
| LOVE-R1Localization Approach=Single-model localization2026.06 | 66.2 | 75.3 | 65.6 | 57.7 | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 66 | — | — | 55 | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 65.9 | — | — | 55.6 | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 65.5 | — | — | 55.4 | |
| E-VRAGEmbedding Model=VLM (2B), Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 65.4 | — | — | — | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 65.3 | — | — | 55 | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 65.3 | — | — | 54.4 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 65.3 | — | — | 56.3 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 65.2 | — | — | 54 | |
| VideoZoomerLocalization Approach=Single-model localization2026.06 | 65.2 | — | — | 55.8 | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 65 | — | — | 54.8 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 64.7 | — | — | 53.9 | |
| BOLTEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 64.6 | — | — | — | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 64.6 | — | — | 54.4 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 64.5 | — | — | 54 | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 64.4 | — | — | 53.2 | |
| LLaVA-Video-7BFrames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 64.2 | — | — | 53.2 | |
| FRAGEmbedding Model=MLLM (7B), Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 63.7 | — | — | — | |
| Qwen2.5-VL-7BFrames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 63.7 | — | — | 52.9 | |
| VPSModel=InternVL3-8B, J=4, Frames=322025.09 | 62.2 | 72.8 | 60.3 | 53.3 | |
| BOLTEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 59.9 | — | — | 49.6 | |
| BaselineModel=InternVL3-8B, Frames=322025.09 | 59.8 | 71.9 | 57 | 50.6 | |
| VPSModel=InternVL3-8B, J=2, Frames=322025.09 | 59.8 | 74.2 | 57 | 50.6 | |
| AdaQEmbedding Model=LongCLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 59.5 | — | — | 49 | |
| AdaQEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 59.3 | — | — | 49.6 | |
| Top-kEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 58.9 | — | — | 48.2 | |
| FRAGEmbedding Model=MLLM (7B), Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 58.6 | — | — | — | |
| AKSEmbedding Model=BLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 58.4 | — | — | 49.3 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 58.4 | — | — | 48.3 | |
| LLaVA-OneVision-7BFrames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 58.3 | — | — | 48.1 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 57.9 | — | — | 47.7 | |
| VPSModel=Qwen2.5-VL-7B, J=4, Frames=322025.09 | 55.3 | 66.8 | 52.3 | 46.7 | |
| VPSModel=Qwen2.5-VL-7B, J=2, Frames=322025.09 | 54.9 | 66.2 | 52.3 | 46.1 | |
| BaselineModel=Qwen2.5-VL-7B, Frames=322025.09 | 53.5 | 65.6 | 50.9 | 44.1 | |
| VPSModel=Gemma3-12B, J=4, Frames=322025.09 | 48 | 52.3 | 46.6 | 45.2 | |
| VPSModel=Gemma3-12B, J=2, Frames=322025.09 | 47.9 | 51.3 | 47 | 45.4 | |
| BaselineModel=Gemma3-12B, Frames=322025.09 | 47.1 | 50.9 | 46.6 | 43.8 |