Long-form Video Question Answering on EgoSchema
77.9AccuracyQwen2.5-VL-72B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL-72BModel Type=Open-Source 72B-78B Model2025.06 | 77.9 | |
| Human Performance2024.04 | 76.2 | |
| GPT-4o(0513)Model Type=Closed-Source Model2025.06 | 72.2 | |
| VideoChat-A1Backbone=InternVL2.5-8B2025.06 | 72.1 | |
| Gemini 1.5 ProModel Type=Closed-Source Model2025.06 | 71.1 | |
| VideoChat-A1Backbone=Qwen2.5-VL-7B2025.06 | 70.7 | |
| VideoChat-A1Backbone=InternVideo2.5-8B2025.06 | 70.1 | |
| VideoMultiAgentsModel Type=Agent Based Model2025.06 | 68 | |
| LongVU-7BModel Type=Open-Source 7B-8B Model2025.06 | 67.6 | |
| LLAVA-Video-72BModel Type=Open-Source 72B-78B Model2025.06 | 65.6 | |
| Qwen2.5-VL-7BModel Type=Open-Source 7B-8B Model2025.06 | 65 | |
| VideoLLaMA-2-72BModel Type=Open-Source 72B-78B Model2025.06 | 63.9 | |
| InternVideo-2.5-8BModel Type=Open-Source 7B-8B Model2025.06 | 63.9 | |
| LLaVA-OneVision-72BModel Type=Open-Source 72B-78B Model2025.06 | 62 | |
| VideoTreeModel Type=Agent Based Model, Backbone=GPT-42025.06 | 61.1 | |
| DrVideoModel Type=Agent Based Model2025.06 | 61 | |
| LLaVA-Video-7BModel Type=Open-Source 7B-8B Model2025.06 | 57.3 | |
| VideoChat2-7BModel Type=Open-Source 7B-8B Model2025.06 | 56.7 | |
| MovieChat+Text Decoder=LLM based, Zero-shot=true2024.04 | 56.4 | |
| VideoAgentModel Type=Agent Based Model2025.06 | 54.1 | |
| MovieChatText Decoder=LLM based, Zero-shot=true2024.04 | 53.5 | |
| Video ChatText Decoder=LLM based, Zero-shot=true2024.04 | 47.5 | |
| FrozenBiLMText Decoder=non-LLM based, Zero-shot=true2024.04 | 26.9 | |
| Choosing the correct answer uniformly at randomZero-shot=true2024.04 | 20 |