Video Understanding on LVBench
102.8Overall AccuracySCORE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SCORERetention Ratio R=25%, Max Frames=1282026.03 | 102.8 | 41.2 | — | |
| SCORERetention Ratio R=40%, Max Frames=1282026.03 | 102.4 | 40.6 | — | |
| VidCom^2Retention Ratio R=40%, Max Frames=1282026.03 | 102.1 | 40.2 | — | |
| DyCokeRetention Ratio R=40%, Max Frames=1282026.03 | 101.7 | 39.8 | — | |
| VidCom^2Retention Ratio R=25%, Max Frames=1282026.03 | 101.6 | 41.3 | — | |
| FastVIDRetention Ratio R=40%, Max Frames=1282026.03 | 100.3 | 39.9 | — | |
| VanillaRetention Ratio R=100%, Max Frames=1282026.03 | 100 | 38.3 | — | |
| FastVIDRetention Ratio R=25%, Max Frames=1282026.03 | 99.8 | 39.7 | — | |
| SCORERetention Ratio R=10%, Max Frames=1282026.03 | 99.5 | 39.6 | — | |
| HoliTomRetention Ratio R=40%, Max Frames=1282026.03 | 99.3 | 39.1 | — | |
| HoliTomRetention Ratio R=25%, Max Frames=1282026.03 | 97.1 | 38.2 | — | |
| FastVIDRetention Ratio R=10%, Max Frames=1282026.03 | 95.9 | 37.8 | — | |
| VidCom^2Retention Ratio R=10%, Max Frames=1282026.03 | 95.3 | 38.6 | — | |
| DyCokeRetention Ratio R=25%, Max Frames=1282026.03 | 94.8 | 37.3 | — | |
| HoliTomRetention Ratio R=10%, Max Frames=1282026.03 | 92.3 | 36.7 | — | |
| LongVPO (128f) Stage 2Size=8B, Frames=768, Backbone=InternVL32026.02 | 53.6 | — | — | |
| LongVPO (128f) Stage 1Size=8B, Frames=512, Backbone=InternVL32026.02 | 52.4 | — | — | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 51.4 | — | — | |
| LongVPO (256f) Stage 2-iter1Size=8B, Frames=512, Backbone=InternVideo2.52026.02 | 51 | — | — | |
| LongVPO (256f) Stage 2-iter2Size=8B, Frames=512, Backbone=InternVideo2.52026.02 | 51 | — | — | |
| LongVPO (256f) Stage 1Size=8B, Frames=512, Backbone=InternVideo2.52026.02 | 50.9 | — | — | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 50.6 | — | — | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 50.5 | — | — | |
| LongVPO (512f) Stage 1Size=8B, Frames=512, Backbone=InternVideo2.52026.02 | 50.4 | — | — | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 50.2 | — | — | |
| LongVPO (128f) Stage 2Size=8B, Frames=512, Backbone=InternVL2.52026.02 | 50.1 | — | — | |
| LongVPO (256f) Stage 1Size=8B, Frames=512, Backbone=InternVL2.52026.02 | 49.6 | — | — | |
| LongVPO (128f) Stage 1Size=8B, Frames=512, Backbone=InternVL2.52026.02 | 49.4 | — | — | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 49.2 | — | — | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 49.1 | — | — | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 49 | — | — | |
| GPT-4oFrame=602026.03 | 48.9 | — | — | |
| InternVL3*Size=8B, Frames=5122026.02 | 48.8 | — | — | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 48.5 | — | — | |
| VideoChat-FlashSize=7B, Frames=5122026.02 | 48.2 | — | — | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 48.2 | — | — | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 47.6 | — | — | |
| InternVideo2.5*Size=8B, Frames=5122026.02 | 47.4 | — | — | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 47.1 | — | — | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 47.1 | — | — | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 47 | — | — | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 46.9 | — | — | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 46.7 | — | — | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 46.5 | — | — | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 46.5 | — | — | |
| Qwen2.5-Omni-3BModel Scale=3B2026.06 | 46.48 | — | — | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 46.4 | — | — | |
| Qwen2.5-VL#S (Model Size)=7B, #F (Number of input frames)=64, Architecture=AR Baseline, reproduced=true2026.01 | 45.3 | — | — | |
| InternVL2.5*Size=8B, Frames=5122026.02 | 45.2 | — | — | |
| AdaQEmbedding Model=LongCLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 44.8 | — | — | |
| VidLaDA#S (Model Size)=8B, #F (Number of input frames)=64, Architecture=DLM Baseline2026.01 | 44.7 | — | — | |
| Q-FrameEmbedding Model=LongCLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 44.3 | — | — | |
| AdaQEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 44.3 | — | — | |
| OneClip-RAGEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 44.1 | — | — | |
| Top-kEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 43.8 | — | — | |
| Qwen3-VL-8BFrames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 43.6 | — | — | |
| AKSEmbedding Model=BLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 43.5 | — | — | |
| EVA-GRPOFrame=26.8*2026.03 | 43.3 | — | — | |
| InternVL2.5Size=8B, Frames=642026.02 | 43.2 | — | — | |
| LLaVA-Video-7BFrames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 41.9 | — | — | |
| LLaVA-Video#S (Model Size)=7B, #F (Number of input frames)=64, Architecture=AR Baseline, reproduced=true2026.01 | 41.5 | — | — | |
| LLaVA-OneVision#S (Model Size)=7B, #F (Number of input frames)=32, Architecture=AR Baseline, reproduced=true2026.01 | 40.7 | — | — | |
| ParaVT-8BSetting=tool-augmented setting (<think>→<tool_call>→<answer>)2026.05 | 39.8 | — | — | |
| Qwen2.5-VL-7BFrames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 39.3 | — | — | |
| LLaVA-OneVision-7BFrames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 38.6 | — | — | |
| ReWatch-R1-7BSetting=reasoning-enhanced setting (<think>→<answer>)2026.05 | 38.5 | — | — | |
| InternVL2.5#S (Model Size)=7B, #F (Number of input frames)=64, Architecture=AR Baseline2026.01 | 38.4 | — | — | |
| AVLM-2BModel Scale=2B2026.06 | 38.22 | — | — | |
| Time-R1-7BSetting=reasoning-enhanced setting (<think>→<answer>)2026.05 | 38.2 | — | — | |
| Conan-7BSetting=tool-augmented setting (<think>→<tool_call>→<answer>)2026.05 | 38.2 | — | — | |
| VideoRFT-7BSetting=reasoning-enhanced setting (<think>→<answer>)2026.05 | 38 | — | — | |
| LongVT-RFT-7BSetting=tool-augmented setting (<think>→<tool_call>→<answer>)2026.05 | 37.9 | — | — | |
| Video-R1-7BSetting=reasoning-enhanced setting (<think>→<answer>)2026.05 | 36.9 | — | — | |
| FrameThinkerFrame=23.92026.03 | 36.6 | — | — | |
| LLaDA-V#S (Model Size)=8B, #F (Number of input frames)=32, Architecture=DLM Baseline, reproduced=true2026.01 | 36.4 | — | — | |
| VideoLLaMA2.1#S (Model Size)=7B, #F (Number of input frames)=32, Architecture=AR Baseline2026.01 | 36.2 | — | — | |
| EVA-KTOFrame=34.5*2026.03 | 36 | — | — | |
| Video-R1Frame=322026.03 | 35.3 | — | — | |
| GPT-4oSetting=best-setting numbers from official reports2026.05 | 34.7 | — | — | |
| VideoChat-R1Frame=322026.03 | 34.3 | — | — | |
| Gemini-1.5-ProSize=Undisclosed2026.02 | 33.1 | — | — | |
| Gemini-1.5-ProFrame=36002026.03 | 33.1 | — | — | |
| Gemini 1.5 ProSetting=best-setting numbers from official reports2026.05 | 33.1 | — | — | |
| Qwen3-VL-8BSetting=tool-augmented setting (<think>→<tool_call>→<answer>)2026.05 | 33.1 | — | — | |
| Qwen2.5-VL-7BSetting=direct-answer setting (native single-pass prompt)2026.05 | 32.2 | — | — | |
| DeepSportFrames=13.22025.11 | 32 | — | — | |
| SAGE-7BSetting=tool-augmented setting (<think>→<tool_call>→<answer>)2026.05 | 31.8 | — | — | |
| Qwen2.5-VL-7B-InstructFrames=322025.11 | 31.6 | — | — | |
| Qwen2.5-VLFrame=322026.03 | 31.6 | — | — | |
| GPT4-oSize=Undisclosed2026.02 | 30.8 | — | — | |
| VideoAgentFrame=25.52026.03 | 29.3 | — | — | |
| EVA-SFTFrame=56.2*2026.03 | 26.5 | — | — | |
| Gemma-4-E2B-itModel Scale=4B2026.06 | 24.92 | — | — | |
| VideoChat-R1-7BSetting=reasoning-enhanced setting (<think>→<answer>)2026.05 | 23.8 | — | — | |
| VideoZoomer-7BSetting=tool-augmented setting (<think>→<tool_call>→<answer>)2026.05 | 22.9 | — | — | |
| AV-Reasoner2025.08 | — | 33.7 | — | |
| Chain-of-Time Reasoning (Ours)2026.04 | — | 59.9 | — | |
| CircleRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=CircleRoPE2025.10 | — | 35.54 | — | |
| DELTAVID-Qwen3-VL-8BParameters=8B, Base Model=Qwen3-VL2026.06 | — | 46.2 | — | |
| Echolnk2025.08 | — | 37.6 | — |