Video Understanding on LongVideoBench (Relation/Perception Metrics)
66.9Overall AccuracyAdaQ
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 66.9 | — | — | 59.8 | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 66.5 | — | — | 59.1 | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 65.5 | — | — | 58.9 | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 65.2 | — | — | 56.9 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 65.1 | — | — | 58.3 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 65 | — | — | 58.3 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 64.8 | — | — | 58.4 | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 64.4 | — | — | 57.7 | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 64.1 | — | — | 57.6 | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 63.8 | — | — | 56.6 | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 63.5 | — | — | 56.4 | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 63.2 | — | — | 57.4 | |
| E-VRAGEmbedding Model=VLM (2B), Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 63.1 | — | — | — | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 63.1 | — | — | 57.2 | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 62.7 | — | — | 54.7 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 62.5 | — | — | 56.2 | |
| BOLTEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 62.2 | — | — | — | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 62.2 | — | — | 55.7 | |
| Qwen3-VL-8BFrames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 62.2 | — | — | 50.7 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 61.5 | — | — | 56.9 | |
| FRAGEmbedding Model=MLLM (7B), Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 60.6 | — | — | — | |
| Qwen2.5-VL-7BFrames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 60.1 | — | — | 50.7 | |
| AdaQEmbedding Model=LongCLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 60 | — | — | 55.3 | |
| AdaQEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 59.8 | — | — | 53.4 | |
| BOLTEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 59.6 | — | — | — | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 59.5 | — | — | 54.6 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 59.4 | — | — | 54 | |
| AKSEmbedding Model=BLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 59.3 | — | — | 53 | |
| LLaVA-Video-7BFrames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 58.9 | — | — | 49.6 | |
| Top-kEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 58.3 | — | — | 50.7 | |
| LLaVA-VideoBase Model=LLaVA-Video-7B, Input Frames=64, Mode=Upper Bound (Full Performance)2026.05 | 58.2 | — | — | — | |
| OneClip-RAGEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 58.1 | — | — | 54.4 | |
| ST-SimDiffBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 57.9 | 52.3 | 64.3 | — | |
| FrameFusionBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 57.6 | 51.7 | 64.2 | — | |
| FRAGEmbedding Model=MLLM (7B), Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 57.6 | — | — | — | |
| ST-SimDiffBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=30%2026.05 | 57.5 | 52.5 | 63.2 | — | |
| PruMergeBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 56.9 | 51.4 | 63.2 | — | |
| VisionZipBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 56.8 | 51.3 | 63.2 | — | |
| LLaVA-OneVision-7BFrames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 56.8 | — | — | 49.5 | |
| FasterVLMBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 56.4 | 51.3 | 62.2 | — | |
| FrameFusionBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=30%2026.05 | 56 | 49.7 | 63.3 | — | |
| FasterVLMBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=30%2026.05 | 55.8 | 51 | 61.3 | — | |
| FastVBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 55.7 | 50.1 | 62.2 | — | |
| PruMergeBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=30%2026.05 | 54.7 | 49.6 | 60.5 | — | |
| FastVBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=30%2026.05 | 53.5 | 48 | 59.9 | — | |
| VisionZipBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=30%2026.05 | 53.2 | 46.9 | 60.3 | — |