Video Question Answering on LongVideoBench (standard)
76.7AccuracyGLM-4.5V-106B
Evaluation Results
| Method | Links | |
|---|---|---|
| GLM-4.5V-106BActive=12B2026.03 | 76.7 | |
| VideoARM (GPT-o3+GPT-4o)Active=Prop.2026.03 | 76.4 | |
| Gemini-3-FlashActive=Prop.2026.03 | 74.5 | |
| GPT-5Active=Prop.2026.03 | 72.6 | |
| Video-RLM (Gemini-3-Flash)Active=Prop.2026.03 | 72 | |
| Claude-Opus-4.5Active=Prop.2026.03 | 67.2 | |
| InternVL3.5-241BActive=28B2026.03 | 67.1 | |
| GPT-4oActive=Prop.2026.03 | 66.7 | |
| LLM over CaptionsActive=Prop.+3B2026.03 | 62.4 | |
| MR.Video (Gemini+GPT-4o)Active=Prop.2026.03 | 61.6 | |
| Qwen3.5 (uniform, 160 fr.)Active=3B2026.03 | 61.5 | |
| EFlowFramework Type=Native Multi-turn Tool Invocation Video MLLM, Open-source status=Open-source2026.07 | 60.3 | |
| Qwen3-VL*Framework Type=Single-Turn Video MLLM, Open-source status=Open-source2026.07 | 59.1 | |
| LLaVA-VideoFramework Type=Single-Turn Video MLLM, Open-source status=Open-source2026.07 | 58.2 | |
| Video-ZoomerFramework Type=Native Multi-turn Tool Invocation Video MLLM, Open-source status=Open-source2026.07 | 57.7 | |
| ConanFramework Type=Native Multi-turn Tool Invocation Video MLLM, Open-source status=Open-source2026.07 | 56.6 | |
| LLaVA-OneVisionFramework Type=Single-Turn Video MLLM, Open-source status=Open-source2026.07 | 56.4 | |
| Qwen2.5-VLFramework Type=Single-Turn Video MLLM, Open-source status=Open-source2026.07 | 56 | |
| Video-RLM (Qwen3.5-3B)Active=3B2026.03 | 52.5 |