Multi-modal Video Evaluation on VideoMME
71.9ScoreGPT-4o
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| GPT-4o2026.06 | 71.9 | — | — | — | — | — | — | — | |
| Qwen2.5-VLLLM backbone=Qwen2.5-7B2026.02 | 65.1 | — | — | — | — | — | — | — | |
| ReMoRaLLM backbone=Qwen2-7B2026.02 | 64.4 | — | — | — | — | — | — | — | |
| LLaVA-Video-7BBackbone=LLaVA-Video-7B, FLOPs (T)=80.9, FLOPs Ratio=100%, Retention Ratio=100%2026.03 | 64.3 | — | — | — | — | — | — | — | |
| Open-o3-Video2026.06 | 63.6 | — | — | — | — | — | — | — | |
| Qwen2-VLLLM backbone=Qwen2-7B2026.02 | 63.3 | — | — | — | — | — | — | — | |
| LLaVA-VideoLLM backbone=Qwen2-7B2026.02 | 63.3 | — | — | — | — | — | — | — | |
| BIMBALLM backbone=Qwen2-7B2026.02 | 63.1 | — | — | — | — | — | — | — | |
| SER-7BParameters=7B2026.06 | 62.9 | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BParameters=7B, Model Version=Base model2026.06 | 62.4 | — | — | — | — | — | — | — | |
| InternVL-2.5-8BParameters=8B2026.06 | 62.3 | — | — | — | — | — | — | — | |
| VideoR1-7BParameters=7B2026.06 | 61.4 | — | — | — | — | — | — | — | |
| LongVULLM backbone=Qwen2-7B2026.02 | 60.6 | — | — | — | — | — | — | — | |
| VideoLLaMA3-7BParameters=7B2026.06 | 60.6 | — | — | — | — | — | — | — | |
| VideoRFT-7BParameters=7B2026.06 | 59.8 | — | — | — | — | — | — | — | |
| LLaVA-OneVisionLLM backbone=Qwen2-7B2026.02 | 58.2 | — | — | — | — | — | — | — | |
| OursBackbone=LLaVA-Video-7B, FLOPs (T)=1.4, FLOPs Ratio=1.7%, Retention Ratio=2%/1%2026.03 | 56.2 | — | — | — | — | — | — | — | |
| KangarooLLM backbone=Llama-3-8B2026.02 | 56 | — | — | — | — | — | — | — | |
| Ours (w/o M)Backbone=LLaVA-Video-7B, FLOPs (T)=1.5, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 55.8 | — | — | — | — | — | — | — | |
| Video-XLLLM backbone=Qwen2-7B2026.02 | 55.5 | — | — | — | — | — | — | — | |
| HoliTomBackbone=LLaVA-Video-7B, FLOPs (T)=1.4, FLOPs Ratio=1.7%, Retention Ratio=2%/1%2026.03 | 55.3 | — | — | — | — | — | — | — | |
| OursBackbone=LLaVA-Video-7B, FLOPs (T)=1.1, FLOPs Ratio=1.4%, Retention Ratio=1%/0.5%2026.03 | 54.9 | — | — | — | — | — | — | — | |
| Ours (w/o M)Backbone=LLaVA-Video-7B, FLOPs (T)=1.2, FLOPs Ratio=1.5%, Retention Ratio=1%2026.03 | 54.6 | — | — | — | — | — | — | — | |
| LongVALLM backbone=Qwen2-7B2026.02 | 54.3 | — | — | — | — | — | — | — | |
| FastVidBackbone=LLaVA-Video-7B, FLOPs (T)=1.5, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 53.6 | — | — | — | — | — | — | — | |
| EMALLM backbone=Qwen2-7B2026.02 | 53.4 | — | — | — | — | — | — | — | |
| HoliTomBackbone=LLaVA-Video-7B, FLOPs (T)=1.1, FLOPs Ratio=1.4%, Retention Ratio=1%/0.5%2026.03 | 51.7 | — | — | — | — | — | — | — | |
| FastVidBackbone=LLaVA-Video-7B, FLOPs (T)=1.2, FLOPs Ratio=1.5%, Retention Ratio=1%2026.03 | 49.3 | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-Video-7B, FLOPs (T)=1.5, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 48.4 | — | — | — | — | — | — | — | |
| FsatVBackbone=LLaVA-Video-7B, FLOPs (T)=10.2, FLOPs Ratio=12.6%, Retention Ratio=100%/2%2026.03 | 48.1 | — | — | — | — | — | — | — | |
| VideoChat2LLM backbone=Vicuna-7B2026.02 | 47.9 | — | — | — | — | — | — | — | |
| Video-LLaMA2LLM backbone=Mistral-7B2026.02 | 47.9 | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-Video-7B, FLOPs (T)=1.2, FLOPs Ratio=1.5%, Retention Ratio=1%2026.03 | 47 | — | — | — | — | — | — | — | |
| LLaVA-NeXT-VideoLLM backbone=Qwen1.5-7B2026.02 | 46.5 | — | — | — | — | — | — | — | |
| FsatVBackbone=LLaVA-Video-7B, FLOPs (T)=9.7, FLOPs Ratio=11.9%, Retention Ratio=100%/1%2026.03 | 46 | — | — | — | — | — | — | — | |
| PLLaVALLM backbone=Vicuna-7B2026.02 | 44.3 | — | — | — | — | — | — | — | |
| LLaVA-OV-0.5BBackbone=LLaVA-OV-0.5B, FLOPs (T)=3.54, FLOPs Ratio=100%, Retention Ratio=100%2026.03 | 43.7 | — | — | — | — | — | — | — | |
| OursBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%/0.5%2026.03 | 40.6 | — | — | — | — | — | — | — | |
| Ours (w/o M)Backbone=LLaVA-OV-0.5B, FLOPs (T)=0.07, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 40.5 | — | — | — | — | — | — | — | |
| Video-LLaVALLM backbone=Vicuna-7B2026.02 | 40.4 | — | — | — | — | — | — | — | |
| OursBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.06, FLOPs Ratio=1.8%, Retention Ratio=2%/1%2026.03 | 40.4 | — | — | — | — | — | — | — | |
| HoliTomBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.06, FLOPs Ratio=1.8%, Retention Ratio=2%/1%2026.03 | 39.4 | — | — | — | — | — | — | — | |
| Ours (w/o M)Backbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%2026.03 | 38.2 | — | — | — | — | — | — | — | |
| HoliTomBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%/0.5%2026.03 | 37.5 | — | — | — | — | — | — | — | |
| FastVidBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.07, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 36.9 | — | — | — | — | — | — | — | |
| FastVidBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%2026.03 | 35 | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.07, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 34.6 | — | — | — | — | — | — | — | |
| FastVBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.50, FLOPs Ratio=14.1%, Retention Ratio=100%/2%2026.03 | 34 | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%2026.03 | 33.3 | — | — | — | — | — | — | — | |
| FastVBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.48, FLOPs Ratio=13.7%, Retention Ratio=100%/1%2026.03 | 32.2 | — | — | — | — | — | — | — | |
| Dispider-7B#Frames=1 fps2026.01 | — | — | — | — | 57.2 | — | — | — | |
| Dispider-7BModel Category=Open-source Online Models, Parameters=7B2025.12 | — | — | — | — | — | 57.2 | — | — | |
| ET-Instruct-3BModel Category=Streamo Framework, Parameters=3B2025.12 | — | — | — | — | — | 56.6 | — | — | |
| ET-Instruct-3B†Model Category=Streamo Framework, Parameters=3B, Variant=Enhanced/Alternative2025.12 | — | — | — | — | — | 59.6 | — | — | |
| FastVIDBase Model=Qwen3-VL-32B-Instruct, Input Frames=32, Retention Ratio=25%2026.03 | — | — | — | 57.7 | 65.1 | — | 75.1 | 62.6 | |
| Flash-VStream-7BModel Category=Open-source Online Models, Parameters=7B2025.12 | — | — | — | — | — | 61.2 | — | — | |
| Gemini 1.5 pro#Frames=1 fps2026.01 | — | — | — | 62.54 | 66.41 | — | — | — | |
| Gemini-1.5-proModel Category=Proprietary Models2025.12 | — | — | — | — | — | 75 | — | — | |
| Gemini-1.5-Pro2024.12 | — | 75 | 81.3 | — | — | — | — | — | |
| GPT-4o2024.12 | — | 71.9 | 77.2 | — | — | — | — | — | |
| GPT-4o2024.12 | — | 71.9 | 77.2 | — | — | — | — | — | |
| GPT-4o#Frames=642026.01 | — | — | — | 60.75 | 62.87 | — | — | — | |
| GPT-4oModel Category=Proprietary Models2025.12 | — | — | — | — | — | 71.9 | — | — | |
| GPT-4o mini2024.12 | — | 61.8 | 68.9 | — | — | — | — | — | |
| GPT-4V2024.12 | — | 59.9 | 63.3 | — | — | — | — | — | |
| HERMESBase Model=LLaVA-OV-7B, Memory Budget=6K tokens, #Frames=0.5 fps2026.01 | — | — | — | 49.11 | 58.44 | — | — | — | |
| HERMESBase Model=LLaVA-OV-7B, Memory Budget=4K tokens, #Frames=0.5 fps2026.01 | — | — | — | 49.22 | 58.85 | — | — | — | |
| HERMESBase Model=Qwen2.5-VL-7B, Memory Budget=6K tokens, #Frames=1 fps2026.01 | — | — | — | 54.44 | 62 | — | — | — | |
| HERMESBase Model=Qwen2.5-VL-7B, Memory Budget=4K tokens, #Frames=1 fps2026.01 | — | — | — | 53.44 | 60.63 | — | — | — | |
| HoliTomBase Model=Qwen3-VL-32B-Instruct, Input Frames=32, Retention Ratio=25%2026.03 | — | — | — | 59.1 | 64.9 | — | 74.2 | 61.2 | |
| InternVL-3.5Model Size=8B2026.03 | — | — | — | — | — | 66 | — | — | |
| InternVL-V2-8B#Frames=162026.01 | — | — | — | — | 56.3 | — | — | — | |
| InternVL2Size=2B, # token/frame=2562024.12 | — | 45 | 47.3 | — | — | — | — | — | |
| InternVL2Size=8B, # token/frame=2562024.12 | — | 54 | 56.9 | — | — | — | — | — | |
| InternVL2Number of Parameters=8B, #Frames=642024.12 | — | 56.3 | 59.3 | — | — | — | — | — | |
| IXC-2.5Size=7B, # token/frame=4002024.12 | — | 55.8 | 58.8 | — | — | — | — | — | |
| KangarooSize=8B, # token/frame=10242024.12 | — | 56 | 57.6 | — | — | — | — | — | |
| LLaVA-NeXT-VideoNumber of Parameters=7B, #Frames=322024.12 | — | 38.5 | — | — | — | — | — | — | |
| LLaVA-OneVisionNumber of Parameters=8B, #Frames=322024.12 | — | 58.2 | 61.5 | — | — | — | — | — | |
| LLaVA-OVSize=7B, # token/frame=1962024.12 | — | 58.2 | 61.5 | — | — | — | — | — | |
| LLaVA-OV-7B#Frames=642026.01 | — | — | — | 48 | 57.67 | — | — | — | |
| LLaVA-VideoSize=7B, # token/frame=1692024.12 | — | 63.3 | 69.7 | — | — | — | — | — | |
| LLaVA-Video-7B#Frames=322026.01 | — | — | — | — | 63.3 | — | — | — | |
| LongVASize=7B, # token/frame=1442024.12 | — | 52.6 | 54.3 | — | — | — | — | — | |
| LongVILANumber of Parameters=7B, #Frames=2562024.12 | — | 60.1 | 65.1 | — | — | — | — | — | |
| LongVUSize=7B, # token/frame=64-1442024.12 | — | — | 60.6 | — | — | — | — | — | |
| LongVUNumber of Parameters=7B, #Frames=1fps2024.12 | — | 60.6 | — | — | — | — | — | — | |
| NVILANumber of Parameters=8B, #Frames=2562024.12 | — | 64.2 | 70 | — | — | — | — | — | |
| OpenAI GPT-5 nanoModel Size=nano2026.03 | — | — | — | — | — | 49.4 | — | — | |
| Oryx MLLMSize=7B, # token/frame=*2024.12 | — | 58.3 | 62.6 | — | — | — | — | — | |
| Oryx-1.5Number of Parameters=8B, #Frames=1282024.12 | — | 58.8 | 64.2 | — | — | — | — | — | |
| Penguin-VLModel Size=8B2026.03 | — | — | — | — | — | 66.2 | — | — | |
| PVC InternVL2Size=2B, # token/frame=642024.12 | — | 54.5 | 56.7 | — | — | — | — | — | |
| PVC InternVL2Size=8B, # token/frame=642024.12 | — | 64.1 | 69.7 | — | — | — | — | — | |
| Qwen2-VLSize=2B, # token/frame=*2024.12 | — | 55.6 | 60.4 | — | — | — | — | — | |
| Qwen2-VLSize=7B, # token/frame=*2024.12 | — | 63.3 | 69 | — | — | — | — | — | |
| Qwen2-VLNumber of Parameters=8B, #Frames=2fps2024.12 | — | 63.3 | 69 | — | — | — | — | — | |
| Qwen2-VL-7B#Frames=642026.01 | — | — | — | — | 63.3 | — | — | — | |
| Qwen2.5-VL-3BModel Category=Streamo Framework, Parameters=3B2025.12 | — | — | — | — | — | 61.5 | — | — | |
| Qwen2.5-VL-7B#Frames=1 fps2026.01 | — | — | — | 53.89 | 64.52 | — | — | — |