Open-ended Video Reasoning on EgoTempo (test)
28.1Accuracy (< 30s)CLiViS (InternVL3)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CLiViS (InternVL3)Paradigm=Video Reasoning, Base VLM=InternVL32025.06 | 28.1 | 19.4 | 23 | |
| CLiViS (VideoLLaMA3)Paradigm=Video Reasoning, Base VLM=VideoLLaMA32025.06 | 23.5 | 23.4 | 23.4 | |
| VideoLLaMA3Paradigm=End-to-End VLM2025.06 | 21.4 | 18.7 | 19.8 | |
| CLiViS (Qwen2.5-VL)Paradigm=Video Reasoning, Base VLM=Qwen2.5-VL2025.06 | 21.4 | 17.8 | 19.6 | |
| Qwen2.5-VLParadigm=End-to-End VLM2025.06 | 18.9 | 14.5 | 16.2 | |
| VideoTreeParadigm=Video Reasoning2025.06 | 18.9 | 13.9 | 14.8 | |
| Video-R1Paradigm=Video Reasoning2025.06 | 18 | 15.4 | 16.4 | |
| AlanaVLMParadigm=Video Reasoning2025.06 | 17.9 | 15.4 | 16.4 | |
| InternVL3Paradigm=End-to-End VLM2025.06 | 15.8 | 17.7 | 17 | |
| Qwen2-VLParadigm=End-to-End VLM2025.06 | 10.3 | 10.5 | 9.6 | |
| InternVL2.5Paradigm=End-to-End VLM2025.06 | 9.7 | 12.1 | 10.2 | |
| VideoLLaMA3 + DeepSeek-V3Paradigm=Socratic-based, Base VLM=VideoLLaMA3, LLM=DeepSeek-V32025.06 | 8.2 | 5.3 | 6.4 | |
| VideoAgentParadigm=Video Reasoning2025.06 | 8.2 | 7.2 | 7.6 | |
| Qwen2.5-VL + Qwen2.5-MaxParadigm=Socratic-based, Base VLM=Qwen2.5-VL, LLM=Qwen2.5-Max2025.06 | 6.7 | 5.3 | 5.8 | |
| Qwen2.5-VL + DeepSeek-V3Paradigm=Socratic-based, Base VLM=Qwen2.5-VL, LLM=DeepSeek-V32025.06 | 6.2 | 4.6 | 5.2 | |
| VideoLLaMA3 + Qwen2.5-MaxParadigm=Socratic-based, Base VLM=VideoLLaMA3, LLM=Qwen2.5-Max2025.06 | 5.1 | 4.6 | 4.8 | |
| InternVL3 + Qwen2.5-MaxParadigm=Socratic-based, Base VLM=InternVL3, LLM=Qwen2.5-Max2025.06 | 3.6 | 1.6 | 2.4 | |
| InternVL3 + DeepSeek-V3Paradigm=Socratic-based, Base VLM=InternVL3, LLM=DeepSeek-V32025.06 | 2.6 | 3.3 | 3 |