Long Video Understanding on MLVU (test)
81Average ScoreSymphony
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Symphony2026.03 | 81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChatA1Model Category=Agent Based2026.03 | 76.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReAgent-VModel Category=Agent Based2026.03 | 74.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoRAGModel Category=Others2026.03 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Seed 1.6 VLModel Category=Open-Source VLMs, reproduced=true2026.03 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoDeepResearchModel Category=Agent Based2026.03 | 64.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoTreeModel Category=Agent Based2026.03 | 60.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QViC-MFSize (LLM)=7B (Qwen2), #Visual Tokens=16, Sampling Rate=2 fps2026.03 | 59.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QViC-MFSize (LLM)=7B (Qwen2), #Visual Tokens=16, Sampling Rate=1 fps2026.03 | 57.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoZoomerSize=7B, Evaluation Protocol=Max 128 frames2025.12 | 55.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oParams=-, Frame=0.5fps2026.02 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oSize=-, Evaluation Protocol=Standard2025.12 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oSize (LLM)=-, #Visual Tokens=-2026.03 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oModel Category=Commercial VLMs2026.03 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-72BModel Category=Open-Source VLMs2026.03 | 53.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VidLaDA#S (Model Size)=8B, #F (Number of input frames)=64, Architecture=DLM Baseline2026.01 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-VideoSize (LLM)=7B (Qwen2), #Visual Tokens=1692026.03 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OVFrames=322025.12 | 51.7 | 83.5 | 56.4 | 46.7 | 58.4 | 58 | — | 35.7 | 23.3 | — | — | 3.75 | 5.09 | 4.42 | — | |
| LLaVA-Video#S (Model Size)=7B, #F (Number of input frames)=64, Architecture=AR Baseline, reproduced=true2026.01 | 50.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoScaffoldFrames=602025.12 | 49.5 | 73.9 | 55 | 55.2 | 48.6 | 52.1 | — | 24.3 | 37.4 | — | — | 3.58 | 5.16 | 4.37 | — | |
| Video-R1Size=7B, Evaluation Protocol=Max 128 frames2025.12 | 49.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LongVILA-7BModel Category=Others2026.03 | 49 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-LLaVAFrames=82025.12 | 47.3 | 71.6 | 57 | 53.2 | 45.2 | 48.4 | — | 20.1 | 35.9 | — | — | 2.43 | 5.25 | 3.84 | — | |
| LLaVA-OneVisionSize=7B, Evaluation Protocol=Standard2025.12 | 47.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoBrainParams=8B, Frame=20.02026.02 | 46.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-SFT + OursFrames=602025.12 | 46.1 | 75 | 56.5 | 43.9 | 46.4 | 47.7 | — | 28.5 | 24.8 | — | — | 3.05 | 4.92 | 3.99 | — | |
| Video-LLaMA2LLM Size=72B, Vision Encoder=CLIP-L2024.11 | 45.6 | 80.2 | 53.8 | 36.7 | 54.7 | 54 | 38.9 | 42.9 | 16.7 | 32.6 | — | — | — | — | — | |
| Video-XLSize=7B, Evaluation Protocol=Standard2025.12 | 45.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLSize=7B, Evaluation Protocol=Max 128 frames2025.12 | 45.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-XLSize (LLM)=7B (Qwen2), #Visual Tokens=162026.03 | 45.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-R1Params=7B, Frame=322026.02 | 45.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL#S (Model Size)=7B, #F (Number of input frames)=64, Architecture=AR Baseline, reproduced=true2026.01 | 45.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision#S (Model Size)=7B, #F (Number of input frames)=32, Architecture=AR Baseline, reproduced=true2026.01 | 45.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat2Frames=162025.12 | 44.5 | 74.6 | 51.5 | 42 | 47.4 | 43.8 | — | 22.8 | 29.6 | — | — | 2.57 | 5.04 | 3.81 | — | |
| LLaDA-V#S (Model Size)=8B, #F (Number of input frames)=32, Architecture=DLM Baseline, reproduced=true2026.01 | 44.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-SFTFrames=162025.12 | 44 | 71.8 | 51 | 41.9 | 44.6 | 42.7 | — | 28.2 | 28.1 | — | — | 2.84 | 4.77 | 3.81 | — | |
| Qwen3-VL-InstructParams=8B, Frame=322026.02 | 43.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L2024.11 | 43 | 83.5 | 43.6 | 55 | 32.1 | 46 | 55.6 | 28.6 | 10 | 32.6 | — | — | — | — | — | |
| Qwen2.5-VL-InstructParams=7B, Frame=322026.02 | 41.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LongVAParams=7B, Frame=1282026.02 | 41.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LongVASize=7B, Evaluation Protocol=Standard2025.12 | 41.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LongVASize (LLM)=7B (Qwen2), #Visual Tokens=1442026.03 | 41.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MA-LMMFrames=10002025.12 | 36.4 | 51.9 | 35.5 | 43.1 | 38.9 | 35.8 | — | 25.1 | 24.3 | — | — | 2.12 | 4.8 | 3.46 | — | |
| ShareGPT4VideoParams=7B, Frame=162026.02 | 33.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TS-LLaVALLM Size=7B, Vision Encoder=CLIP-L2024.11 | 33.6 | 76.9 | 38.5 | 28.3 | 34 | 30 | 30.6 | 25.7 | 20 | 18.6 | — | — | — | — | — | |
| LLaMA-VIDFrames=12025.12 | 33.2 | 50.8 | 34.5 | 30.1 | 32.7 | 32.5 | — | 23.9 | 27.8 | — | — | 3.22 | 5.22 | 4.22 | — | |
| Video-ChatGPTFrames=1002025.12 | 31.3 | 26.9 | 24 | 40.3 | 42 | 29.9 | — | 25.1 | 31.1 | — | — | 2.31 | 5.48 | 3.9 | — | |
| Video-LLaVALLM Size=7B, Vision Encoder=ViT-L2024.11 | 30.7 | 70.3 | 38.5 | 13.3 | 26.4 | 26 | 38.9 | 20 | 21.7 | 20.9 | — | — | — | — | — | |
| Video-LLaVASize=7B, Evaluation Protocol=Standard2025.12 | 30.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat2LLM Size=7B, Vision Encoder=UMT-L2024.11 | 30.1 | 72.5 | 30.8 | 18.3 | 28.3 | 26 | 36.1 | 17.1 | 23.3 | 18.6 | — | — | — | — | — | |
| MovieChatFrames=20482025.12 | 25.8 | 29.5 | 25 | 24.2 | 24.7 | 25.8 | — | 28.6 | 22.8 | — | — | 2.33 | 3.23 | 2.78 | — | |
| LLaVA-NeXT-ImageLLM Size=7B, Vision Encoder=CLIP-L2024.11 | 25.3 | 63.7 | 17.9 | 13.3 | 26.4 | 30 | 22.2 | 21.4 | 16.7 | 16.3 | — | — | — | — | — | |
| MA-LMMSize (LLM)=7B (Vicuna-v1.1), #Visual Tokens=322026.03 | 22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-ChatGPTLLM Size=7B, Vision Encoder=CLIP-L2024.11 | 20.9 | 17.6 | 17.9 | 28.3 | 32.1 | 22 | 27.8 | 17.1 | 13.3 | 11.6 | — | — | — | — | — | |
| Video-LLaMA2LLM Size=13B, Vision Encoder=CLIP-L2024.11 | 18.9 | 52.7 | 12.8 | 13.3 | 17 | 12 | 19.4 | 15.7 | 8.3 | 18.6 | — | — | — | — | — | |
| MovieChatLLM Size=7B, Vision Encoder=CLIP-G2024.11 | 18 | 18.7 | 10.3 | 23.3 | 15.1 | 16 | 30.6 | 17.1 | 15 | 16.3 | — | — | — | — | — | |
| MovieChatSize (LLM)=7B (Vicuna-v0), #Visual Tokens=322026.03 | 18 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-VIDLLM Size=7B, Vision Encoder=CLIP-G2024.11 | 17.2 | 20.9 | 23.1 | 21.7 | 11.3 | 16 | 16.7 | 18.6 | 15 | 11.6 | — | — | — | — | — | |
| LLaMA-VIDSize (LLM)=7B (Vicuna-v1.5), #Visual Tokens=22026.03 | 17.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChatLLM Size=7B, Vision Encoder=CLIP-G2024.11 | 16.6 | 26.4 | 12.8 | 18.3 | 17 | 22 | 11.1 | 15.7 | 11.7 | 14 | — | — | — | — | — | |
| AdaReTaKe2025.12 | — | — | — | — | — | — | — | — | — | — | 78.1 | — | — | — | — | |
| AVPBackbone=Gemini-2.5-Flash2025.12 | — | — | — | — | — | — | — | — | — | — | 74.1 | — | — | — | — | |
| AVPBackbone=Gemini-2.5-Pro2025.12 | — | — | — | — | — | — | — | — | — | — | 84.3 | — | — | — | — | |
| FastVBackbone=LLaVA-Video-7B, Retention Ratio=25%, Input Frames=642026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 57.8 | |
| FrameMind2025.12 | — | — | — | — | — | — | — | — | — | — | 48.6 | — | — | — | — | |
| Gemini-1.5-ProParam=-, Frames=2562026.03 | — | — | — | — | — | — | — | — | — | — | 53.8 | — | — | — | — | |
| Gemini-2.5-Flash2025.12 | — | — | — | — | — | — | — | — | — | — | 72.4 | — | — | — | — | |
| Gemini-2.5-Pro2025.12 | — | — | — | — | — | — | — | — | — | — | 79.6 | — | — | — | — | |
| GPT-4o#Frames=384, Model Type=Closed-source Models2026.01 | — | — | — | — | — | — | — | — | — | — | 54.9 | — | — | — | — | |
| GPT-4o2025.12 | — | — | — | — | — | — | — | — | — | — | 54.9 | — | — | — | — | |
| GPT-4oParam=-, Frames=3842026.03 | — | — | — | — | — | — | — | — | — | — | 54.9 | — | — | — | — | |
| GPT-4oPerception budget constraint=false, Perc. budget=-2026.05 | — | — | — | — | — | — | — | — | — | — | 54.9 | — | — | — | — | |
| HoliTomBackbone=LLaVA-Video-7B, Retention Ratio=25%, Input Frames=642026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 60.5 | |
| InternVL-2.5Param=8B, Frames=322026.03 | — | — | — | — | — | — | — | — | — | — | 52.8 | — | — | — | — | |
| InternVL2.5-VL-8BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | — | — | — | — | — | — | — | — | — | — | 39.1 | — | — | — | — | |
| InternVL3.5-241B-A28BFrames=–2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.2 | |
| Kangaroo-8BPerception budget constraint=false, Perc. budget=-2026.05 | — | — | — | — | — | — | — | — | — | — | 46.5 | — | — | — | — | |
| Keye1.5-VL-8BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | — | — | — | — | — | — | — | — | — | — | 41.6 | — | — | — | — | |
| Language AgentModel Type=Agentic LLMs, Base Model=Qwen-235B w/ our tools2026.01 | — | — | — | — | — | — | — | — | — | — | 50.9 | — | — | — | — | |
| LatentMASPerception budget constraint=true, Perc. budget=16*224*224, VLM engine=Qwen3-VL-8B2026.05 | — | — | — | — | — | — | — | — | — | — | 42.3 | — | — | — | — | |
| LLaVA-OneVisionParam=7B, Frames=-2026.03 | — | — | — | — | — | — | — | — | — | — | 47.2 | — | — | — | — | |
| LLaVA-OneVision1.5-8BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | — | — | — | — | — | — | — | — | — | — | 41.8 | — | — | — | — | |
| LLaVA-Video-7BBackbone=LLaVA-Video-7B, Retention Ratio=100%, Input Frames=642026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.3 | |
| LongVILA-7B#Frames=256, Model Type=Open-source Models2026.01 | — | — | — | — | — | — | — | — | — | — | 49 | — | — | — | — | |
| LongVU2025.12 | — | — | — | — | — | — | — | — | — | — | 65.4 | — | — | — | — | |
| LVAgentAuxiliary Subtitles=true2025.12 | — | — | — | — | — | — | — | — | — | — | 83.9 | — | — | — | — | |
| MACF (LLaVA-OV1.5-8B)Perception budget constraint=true, Perc. budget=16*224*224, Backbone=LLaVA-OneVision1.5-8B2026.05 | — | — | — | — | — | — | — | — | — | — | 49.4 | — | — | — | — | |
| MACF (Qwen2.5-VL-7B)Perception budget constraint=true, Perc. budget=16*224*224, Backbone=Qwen2.5-VL-7B2026.05 | — | — | — | — | — | — | — | — | — | — | 47.6 | — | — | — | — | |
| MACF (Qwen3-VL-8B)Perception budget constraint=true, Perc. budget=16*224*224, Backbone=Qwen3-VL-8B2026.05 | — | — | — | — | — | — | — | — | — | — | 49.2 | — | — | — | — | |
| MapReducePerception budget constraint=true, Perc. budget=16*224*224, VLM engine=Qwen3-VL-8B2026.05 | — | — | — | — | — | — | — | — | — | — | 33.3 | — | — | — | — | |
| Qwen-3-VL2025.12 | — | — | — | — | — | — | — | — | — | — | 84.3 | — | — | — | — | |
| Qwen2.5-VLParam=7B, Frames=1282026.03 | — | — | — | — | — | — | — | — | — | — | 45.5 | — | — | — | — | |
| Qwen2.5-VLParam=72B, Frames=1282026.03 | — | — | — | — | — | — | — | — | — | — | 53.8 | — | — | — | — | |
| Qwen2.5-VL-72BFrames=7682026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 74.6 | |
| Qwen2.5-VL-72BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | — | — | — | — | — | — | — | — | — | — | 44.2 | — | — | — | — | |
| Qwen2.5-VL-7BPerception budget constraint=true, Perc. budget=16*224*2242026.05 | — | — | — | — | — | — | — | — | — | — | 38.7 | — | — | — | — | |
| Qwen2.5-VL-7B-InstructFrames=642026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 57.1 | |
| Qwen2.5-VL-7B-InstructFrames=1282026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 63 | |
| Qwen2.5-VL-7B-Instruct + Bottom-KFrames=64+42026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 55.9 | |
| Qwen2.5-VL-7B-Instruct + Bottom-KFrames=128+82026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 62.3 |