Video reasoning on EgoSchema (test)
69.4AccuracyCLiViS (InternVL3)
Evaluation Results
| Method | Links | |
|---|---|---|
| CLiViS (InternVL3)Paradigm=Video Reasoning, Base VLM=InternVL32025.06 | 69.4 | |
| CLiViS (Qwen2.5-VL)Paradigm=Video Reasoning, Base VLM=Qwen2.5-VL2025.06 | 68.2 | |
| InternVL3Paradigm=End-to-End VLM2025.06 | 66.6 | |
| Qwen2.5-VLParadigm=End-to-End VLM2025.06 | 64.8 | |
| CLiViS (VideoLLaMA3)Paradigm=Video Reasoning, Base VLM=VideoLLaMA32025.06 | 64.8 | |
| InternVL2.5Paradigm=End-to-End VLM2025.06 | 63.2 | |
| MECOTComponents=Instruction fine-tuning (IFT) + Chain-of-Thought (CoT)2025.12 | 62.25 | |
| VideoLLaMA3Paradigm=End-to-End VLM2025.06 | 62.2 | |
| VideoAgentParadigm=Video Reasoning2025.06 | 62 | |
| VideoLLaMA3 + Qwen2.5-MaxParadigm=Socratic-based, Base VLM=VideoLLaMA3, LLM=Qwen2.5-Max2025.06 | 61.8 | |
| LLoVIBase Model=LV-OV2025.12 | 61.66 | |
| VideoAgentBase Model=LV-OV2025.12 | 61.1 | |
| LV-OVDescription=Baseline model2025.12 | 60.1 | |
| VideoTreeParadigm=Video Reasoning2025.06 | 60 | |
| LVNetParadigm=Video Reasoning2025.06 | 58.8 | |
| Qwen2.5-VL + Qwen2.5-MaxParadigm=Socratic-based, Base VLM=Qwen2.5-VL, LLM=Qwen2.5-Max2025.06 | 58.6 | |
| InternVL3 + Qwen2.5-MaxParadigm=Socratic-based, Base VLM=InternVL3, LLM=Qwen2.5-Max2025.06 | 57.2 | |
| Qwen2.5-VL + DeepSeek-V3Paradigm=Socratic-based, Base VLM=Qwen2.5-VL, LLM=DeepSeek-V32025.06 | 55.6 | |
| VideoLLaMA3 + DeepSeek-V3Paradigm=Socratic-based, Base VLM=VideoLLaMA3, LLM=DeepSeek-V32025.06 | 55.2 | |
| InternVL3 + DeepSeek-V3Paradigm=Socratic-based, Base VLM=InternVL3, LLM=DeepSeek-V32025.06 | 54 | |
| Qwen2-VLParadigm=End-to-End VLM2025.06 | 48.4 | |
| Video-R1Paradigm=Video Reasoning2025.06 | 46.6 | |
| AlanaVLMParadigm=Video Reasoning2025.06 | 32.2 |