Long Video Understanding on LVBench
77AccuracyGemini 1.5 Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini 1.5 ProSource=[59]2026.06 | 77 | — | |
| Seed2.0 Pro2026.06 | 76.4 | — | |
| Gemini 1.5 ProSource=[60]2026.06 | 75.7 | — | |
| AVPAvg. Inference Time (s)=145.3, Avg. Input Tokens (K)=132.52025.12 | 74.8 | — | |
| AVPBackbone=Gemini-2.5-Pro2025.12 | 74.8 | — | |
| DVDAvg. Inference Time (s)=790.5, Avg. Input Tokens (K)=1071.62025.12 | 74.2 | — | |
| DeepVideoDiscovery (DVD)2025.12 | 74.2 | — | |
| Deep Video Discovery2026.03 | 74.2 | — | |
| Seed1.82026.06 | 73 | — | |
| Seed2.0 Lite2026.06 | 73 | — | |
| LensWalkReasoner=o3, Observer=o32026.03 | 68.6 | — | |
| Qwen-3-VL2025.12 | 67.7 | — | |
| Gemini-2.5-Pro2025.12 | 67.4 | — | |
| LensWalkReasoner=GPT-5, Observer=GPT-52026.03 | 66.9 | — | |
| LensWalkReasoner=o3, Observer=GPT-4.12026.03 | 66.8 | — | |
| Seed2.0 Mini2026.06 | 66.6 | — | |
| GPT-4o2026.06 | 65.2 | — | |
| Gemini 1.5 Flash2026.06 | 64.9 | — | |
| Seed-1.5-VL2025.12 | 64.6 | — | |
| AVPBackbone=Gemini-2.5-Flash2025.12 | 63.8 | — | |
| Qwen3-VL-235B-A22BFrames=7682026.01 | 63.6 | — | |
| GPT-4.12025.12 | 63.4 | — | |
| L2-VMASBackbone=Qwen3-VL-8B, Mode=Thinking2026.01 | 61.5 | — | |
| MR. Video2026.03 | 60.8 | — | |
| GPT-52026.07 | 60.4 | — | |
| L2-VMASBackbone=Qwen3-VL-8B, Mode=Instruct2026.01 | 60 | — | |
| GPT-52026.03 | 59.8 | — | |
| LensWalkReasoner=o3, Observer=Qwen2.5-VL-72B2026.03 | 59.4 | — | |
| VideoLucy2025.12 | 58.8 | — | |
| PyraVidModel Size=32B2026.05 | 58.5 | — | |
| VMASBackbone=Qwen3-VL-8B, Mode=Thinking2026.01 | 58.4 | — | |
| AdaCodecToken budget=comparable, Backbone=Qwen2-VL-7B2026.06 | 58.4 | — | |
| AdaCodecToken budget=1/7, Backbone=Qwen2-VL-7B2026.06 | 58.2 | — | |
| SingleBackbone=Qwen3-VL-8B, Mode=Thinking2026.01 | 58.1 | — | |
| Qwen2-VL-7B2026.06 | 58 | — | |
| VMASBackbone=Qwen3-VL-8B, Mode=Instruct2026.01 | 57.5 | — | |
| o32026.03 | 57.1 | — | |
| Gemini 2.5 Pro2026.07 | 57 | — | |
| DynFrame-8BSize=8B2026.05 | 56.9 | — | |
| Gemini-2.5-Flash2025.12 | 56.7 | — | |
| Qwen3-VL (Thinking)Size=8B2026.05 | 55.8 | — | |
| OmniMemBackbone=video-SALMONN 2+ (8B), fine-tuned=true2026.05 | 55.7 | — | |
| SingleBackbone=Qwen3-VL-8B, Mode=Instruct2026.01 | 55.4 | — | |
| WorldMM-8BSize=8B2026.07 | 55.4 | — | |
| DynFrame-4BSize=4B2026.05 | 54.8 | — | |
| GPT-4o mini2026.06 | 54.7 | — | |
| OmniMemBackbone=video-SALMONN 2+ (4B), fine-tuned=true2026.05 | 54.4 | — | |
| Video-Thinker-7BReasoning Prompt=true, Tool Calling=false, Frame Sampling Regime=Dense2025.11 | 54.3 | 42.9 | |
| Qwen3-VL (Thinking)Size=4B2026.05 | 53.5 | — | |
| AdaReTaKe2025.12 | 53.3 | — | |
| AdaReTaKe2026.03 | 53.3 | — | |
| OmniMemBackbone=video-SALMONN 2+ (8B), fine-tuned=false2026.05 | 53.3 | — | |
| Molmo2-8B2026.06 | 52.8 | — | |
| Video-Thinker-7BReasoning Prompt=true, Tool Calling=false, Frame Sampling Regime=Sparse2025.11 | 52.2 | 42.6 | |
| GPT-4.12026.03 | 51.9 | — | |
| VideoDetective (SeedVL-1.5)Param=20B(A), Frames=322026.03 | 51.3 | — | |
| Eagle-X5-7B2026.06 | 50.9 | — | |
| RLER2026.04 | 50.7 | — | |
| PyraVidModel Size=8B2026.05 | 50.6 | — | |
| Claude 3.5 Sonnet2026.06 | 50.5 | — | |
| MiniCPM-V-2.6-8B2026.06 | 50.4 | — | |
| QViC-MFSize (LLM)=7B (Qwen2), #Visual Tokens=16, Sampling Rate=1 fps2026.03 | 50.3 | — | |
| StreamMemBackbone=video-SALMONN 2+ (8B)2026.05 | 50.3 | — | |
| OmniMemBackbone=video-SALMONN 2+ (4B), fine-tuned=false2026.05 | 50.3 | — | |
| Ours:base Qwen2.5Params (B)=14+72, Time (s)=3.22025.08 | 50.27 | — | |
| QViC-MFSize (LLM)=7B (Qwen2), #Visual Tokens=16, Sampling Rate=2 fps2026.03 | 50.2 | — | |
| Light-OmniSize=7B2026.07 | 49.9 | — | |
| HERMESBackbone=video-SALMONN 2+ (8B)2026.05 | 49.8 | — | |
| Molmo2-O-7B2026.06 | 49.6 | — | |
| M3-AgentModel Size=32B, Variant=RL2026.05 | 49.3 | — | |
| M3-AgentSize=32B2026.07 | 49.3 | — | |
| Gemini-2.0-FlashVariant=Flash2026.05 | 49.25 | — | |
| Qwen2.5-VLParams (B)=322025.08 | 49 | — | |
| GPT-4oParams=-, Frame=602026.02 | 48.9 | — | |
| GPT-4oSize=-, Evaluation Protocol=Standard2025.12 | 48.9 | — | |
| GPT-4o2025.12 | 48.9 | — | |
| GPT-4oParam=-, Frames=3842026.03 | 48.9 | — | |
| GPT-4o2026.03 | 48.9 | — | |
| VideoChat-R1.52026.04 | 48.4 | — | |
| VideoChat-R1.5Size=7B2026.05 | 48.4 | — | |
| Gemini-2.0-Flash2026.03 | 48.3 | — | |
| Qwen3-VL-8BSize=8B2026.07 | 48.3 | — | |
| VideoChat-Flash-7BSize=7B2026.04 | 48.2 | — | |
| VideoChat-FlashModel Size=7B, Video Tokens=8K2025.11 | 48.2 | — | |
| LOVE-R1Size=7B2026.05 | 48.2 | — | |
| VideoChat-Flash-7B2026.06 | 48.2 | — | |
| Qwen2-VL w/ Q-FoldFrames=32, LLM Size=7B2026.06 | 47.8 | — | |
| ReKVFrames=0.5fps, Tokens=12k2026.06 | 47.8 | — | |
| Qwen2.5-VL-72B2026.03 | 47.7 | — | |
| InfiniPot-VBackbone=video-SALMONN 2+ (8B)2026.05 | 47.7 | — | |
| Video-o3Size=7B2026.05 | 47.6 | — | |
| Qwen2.5-VLParam=72B, Frames=1282026.03 | 47.4 | — | |
| UniformBackbone=video-SALMONN 2+ (8B)2026.05 | 47.4 | — | |
| Qwen2.5-VL-72BFrames=7682026.01 | 47.3 | — | |
| Qwen2.5-VLParams (B)=722025.08 | 47.3 | — | |
| HERMESBackbone=video-SALMONN 2+ (4B)2026.05 | 47.3 | — | |
| MiMo-VL w/ Q-FoldFrames=32, LLM Size=7B2026.06 | 47.3 | — | |
| StreamMemBackbone=video-SALMONN 2+ (4B)2026.05 | 47.1 | — | |
| InternVL3Size=8B2026.05 | 47 | — | |
| InfiniPot-VBackbone=video-SALMONN 2+ (4B)2026.05 | 46.8 | — |