Long Video Understanding on LongVideoBench (Accuracy)
80.3AccuracySeed2.0 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Seed2.0 Pro2026.06 | 80.3 | |
| Seed1.82026.06 | 77.4 | |
| Seed2.0 Lite2026.06 | 77.3 | |
| Gemini-3-Pro2026.06 | 76.7 | |
| Seed2.0 Mini2026.06 | 74.8 | |
| Gemini-3-Flash2026.06 | 74.5 | |
| Penguin-VLModel Size=8B2026.03 | 67 | |
| GPT-4o2026.04 | 66.7 | |
| GPT-4oSize=-2026.04 | 66.7 | |
| GPT-4oPerception budget constraint=false, Perc. budget=-2026.05 | 66.7 | |
| Eagle2.5-8BSize=8B2026.04 | 66.4 | |
| VideoChat-Flash-7BSize=7B2026.04 | 64.7 | |
| Gemini-1.5-ProSize=-2026.04 | 64 | |
| Qwen3-VLArchitecture Type=Modular, Parameter Scale=8B, Training Stage=Instruct2026.05 | 63.6 | |
| NEO-ovArchitecture Type=Native, Parameter Scale=8B, Training Stage=Instruct2026.05 | 63.5 | |
| RLER2026.04 | 63 | |
| Qwen3-VLModel Size=8B2026.03 | 62.6 | |
| InternVL3-9BSize=9B2026.04 | 62.5 | |
| InternVL-3.5Model Size=8B2026.03 | 62.1 | |
| InternVL3.5Architecture Type=Modular, Parameter Scale=8B, Training Stage=Instruct2026.05 | 62.1 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v32026.05 | 61.2 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v12026.05 | 61 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v52026.05 | 60.9 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 60.7 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v42026.05 | 60.7 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 60.6 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 60.6 | |
| Video-Zero (Peak)Backbone=Qwen3-VL-8B-Instruct2026.05 | 60.6 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 60.5 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct2026.05 | 60.5 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 60.4 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 60.4 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 60.4 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 60.4 | |
| Video-Zero (Iter 4)Backbone=Qwen3-VL-8B-Instruct2026.05 | 60.4 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v22026.05 | 60.4 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 60.3 | |
| InternVL3.5-4BCheckpoint=Base2026.05 | 60.3 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 60.2 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 60.2 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 60.1 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct2026.05 | 60.1 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 60 | |
| mPLUG-Owl3-8B2026.04 | 59.8 | |
| VideoLLaMA3-7BPerception budget constraint=false, Perc. budget=-2026.05 | 59.8 | |
| Base ModelBackbone=Qwen3-VL-8B-Instruct2026.05 | 59.8 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 59.8 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 59.8 | |
| Base ModelBackbone=Qwen3-VL-8B-Instruct2026.05 | 59.8 | |
| VideoLLaMA3Architecture Type=Modular, Parameter Scale=8B, Training Stage=Instruct2026.05 | 59.8 | |
| XCompSize=2B2026.04 | 59.7 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 59.6 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 59.6 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 59.6 | |
| Video-Zero (Peak)Backbone=Qwen3-VL-4B-Instruct2026.05 | 59.6 | |
| LLaVA-Video-7B2026.04 | 59.5 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 59.5 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct2026.05 | 59.5 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 59.4 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 59.3 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 59.2 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 59.2 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 59.2 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct2026.05 | 59.2 | |
| GPT-4VSize=-2026.04 | 59.1 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 59.1 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 59.1 | |
| Video-Zero (Iter 4)Backbone=Qwen3-VL-4B-Instruct2026.05 | 59.1 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 58.9 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 58.6 | |
| VideoChat-Flash-2BSize=2B2026.04 | 58.3 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 58.2 | |
| LLaVA-VideoArchitecture Type=Modular, Parameter Scale=8B, Training Stage=Instruct2026.05 | 58.2 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 58 | |
| Base ModelBackbone=Qwen3-VL-4B-Instruct2026.05 | 57.7 | |
| Base ModelBackbone=Qwen3-VL-4B-Instruct2026.05 | 57.7 | |
| MACF (LLaVA-OV1.5-8B)Perception budget constraint=true, Perc. budget=16*224*224, Backbone=LLaVA-OneVision1.5-8B2026.05 | 57.6 | |
| InternVL3.5Architecture Type=Modular, Parameter Scale=2B, Training Stage=Instruct2026.05 | 57.4 | |
| VideoLLaMA3Architecture Type=Modular, Parameter Scale=2B, Training Stage=Instruct2026.05 | 57.1 | |
| MACF (Qwen3-VL-8B)Perception budget constraint=true, Perc. budget=16*224*224, Backbone=Qwen3-VL-8B2026.05 | 56.8 | |
| NEO-ovArchitecture Type=Native, Parameter Scale=2B, Training Stage=Instruct2026.05 | 56.8 | |
| Keye1.5-VL-8BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | 56.4 | |
| TimeMarkerSize=8B2026.04 | 56.3 | |
| Qwen2.5-VL-7B2026.04 | 56 | |
| Qwen3-VL-30BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | 55.9 | |
| Qwen3-VLArchitecture Type=Modular, Parameter Scale=2B, Training Stage=Instruct2026.05 | 55.6 | |
| InternVL3-2BSize=2B2026.04 | 55.4 | |
| KangarooSize=8B2026.04 | 54.8 | |
| Kangaroo-8BPerception budget constraint=false, Perc. budget=-2026.05 | 54.8 | |
| LLaVA-OneVision1.5-8BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | 54.4 | |
| MACF (Qwen2.5-VL-7B)Perception budget constraint=true, Perc. budget=16*224*224, Backbone=Qwen2.5-VL-7B2026.05 | 52.5 | |
| mPLUG-Owl3Size=7B2026.04 | 52.1 | |
| Qwen2.5-VL-72BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | 51 | |
| Qwen3-VL-8BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | 50.7 | |
| LLaVA-Next-Video-34BPerception budget constraint=false, Perc. budget=-2026.05 | 50.5 | |
| LatentMASPerception budget constraint=true, Perc. budget=16*224*224, VLM engine=Qwen3-VL-8B2026.05 | 48.5 | |
| Qwen2.5-VL-7BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | 48.1 | |
| InternVL2.5-VL-8BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | 43.4 | |
| Qwen2.5VL-3BSize=3B2026.04 | 43.3 | |
| ShareGPT4Video-8BPerception budget constraint=false, Perc. budget=-2026.05 | 41.8 |