Online Video Understanding on OVOBench 1.0 (test)
93.2Real-Time PerceptionHuman Agents
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Human AgentsModel Category=Baseline2026.04 | 93.2 | 92.6 | 91.1 | 92.3 | 92.9 | 92.8 | |
| Qwen3-VL#Frames=4, Model Size=8B2026.04 | 82.3 | — | — | 49.3 | 45 | — | |
| Gemini-3-Flash#Frames=12026.04 | 81.8 | — | — | 64.4 | 45.2 | — | |
| Qwen2.5-VL#Frames=4, Model Size=7B2026.04 | 75.3 | — | — | 42.3 | 39 | — | |
| Qwen3-VL#Frames=1, Model Size=8B2026.04 | 74.7 | — | — | 50.3 | 40.8 | — | |
| StreamBridge#Frames=1fps, Model Size=7B2026.04 | 71.3 | — | — | 68 | 48.4 | — | |
| Gemini 1.5 ProModel Category=Proprietary MLLM2026.04 | 70.8 | 67 | 68.3 | 62.3 | 57.2 | 65.3 | |
| GPT-5#Frames=12026.04 | 70.4 | — | — | 51.8 | 40.5 | — | |
| Qwen2.5-VL#Frames=1, Model Size=7B2026.04 | 67.8 | — | — | 44 | 36.9 | — | |
| Thinking-QwenVLModel Category=Open-source Online Video-LLM, Sampling Constraint=100%2026.04 | 64.7 | 57.2 | 75 | 44.3 | 37.6 | 52.5 | |
| GPT-4oModel Category=Proprietary MLLM2026.04 | 63.6 | 65.1 | 68.3 | 58.7 | 53.4 | 58.6 | |
| LLaVA-NeXT-Video-7BModel Category=Open-source Offline Long-Video LLM, Size=7B2026.04 | 63.3 | 59.6 | 72.3 | 41.7 | 54.2 | 53.1 | |
| LLaVA-OneVision-7BModel Category=Open-source Offline Long-Video LLM, Size=7B2026.04 | 62.8 | 58.7 | 71.3 | 45 | 50.9 | 52.9 | |
| TimeChat-Online-7BModel Category=Open-source Online Video-LLM, Size=7B, Sampling Constraint=100%2026.04 | 61.9 | 46.8 | 69.3 | 41.7 | 36.7 | 46.7 | |
| Timechat-Online#Frames=1fps, Model Size=7B2026.04 | 61.9 | — | — | 41.7 | 36.7 | — | |
| StreamAgent#Frames=1fps, Model Size=7B2026.04 | 61.3 | — | — | 41.7 | 45.4 | — | |
| StreamForest#Frames=1fps, Model Size=7B2026.04 | 61.2 | — | — | 52 | 53.5 | — | |
| Qwen2-VL-7BModel Category=Open-source Offline Long-Video LLM, Size=7B2026.04 | 60.7 | 53.2 | 66.3 | 48.6 | 48.9 | 52.7 | |
| LongVU-7BModel Category=Open-source Offline Long-Video LLM, Size=7B2026.04 | 57.4 | 49.5 | 68.3 | 39.5 | 48.5 | 48.5 | |
| Thinking-QwenVLModel Category=Open-source Online Video-LLM, Sampling Constraint=93.75%2026.04 | 55.8 | 54.9 | 67.5 | 47.4 | 28.6 | 46.9 | |
| Dispider-7BModel Category=Open-source Online Video-LLM, Size=7B2026.04 | 54.5 | 49.5 | 61.4 | 36.1 | 34.7 | 41.8 | |
| Gemini-3-Flash#Frames=02026.04 | 44.8 | — | — | 55.3 | 33.9 | — | |
| GPT-5#Frames=02026.04 | 36.6 | — | — | 58.1 | 32.3 | — | |
| Qwen2.5-VL#Frames=0, Model Size=7B2026.04 | 30 | — | — | 49.1 | 28.7 | — | |
| Flash-VStream-7BModel Category=Open-source Online Video-LLM, Size=7B2026.04 | 29.9 | 32.1 | 29.7 | 25.4 | 44.2 | 33.2 | |
| Qwen3-VL#Frames=0, Model Size=8B2026.04 | 29.2 | — | — | 44.3 | 32 | — | |
| VideoLLM-online-8BModel Category=Open-source Online Video-LLM, Size=8B2026.04 | 20.8 | 23.9 | 45.5 | 17.7 | — | — |