Multiple Choice Video Question Answering on EgoSchema
72.2AccuracyGemini-1.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-1.5-Prozero-shot=true2025.03 | 72.2 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 66.2 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 66.2 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 66.2 | |
| Gemini-1.5-Flashzero-shot=true2025.03 | 65.7 | |
| DrVideoLLM=GPT-42024.06 | 61 | |
| VideoAgentLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 60.2 | |
| VideoAgentLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 60.2 | |
| VideoAgentLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 60.2 | |
| VideoAgentLLM=GPT-4, Reference=[14]2024.06 | 60.2 | |
| LLaVA-OV-7Bzero-shot=true2025.03 | 60.1 | |
| LLaVAction-7Bzero-shot=true2025.03 | 59 | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 57.8 | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 57.8 | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 57.8 | |
| LLaVA-Video-7Bzero-shot=true2025.03 | 57.3 | |
| KTV-34B-denseLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=dense2026.02 | 57 | |
| DYTOLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 56.8 | |
| MovieChat+LLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=Video-trained2024.11 | 56.4 | |
| MovieChat+LLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=Video-trained2024.11 | 56.4 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 55.8 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 55.8 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 55.8 | |
| KTV-34B-sparseLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=sparse2026.02 | 55.6 | |
| KTV-34B-normalLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=normal2026.02 | 55.6 | |
| SF-LLaVA-7BLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 55 | |
| VideoAgentLLM=GPT-4, Reference=[61]2024.06 | 54.1 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 53.6 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 53.6 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 53.6 | |
| IG-VLMLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 53.4 | |
| Video-LLAMA2LLM Size=46.7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 53.3 | |
| VideoLLaMA2LLM Size=46.7B, Vis Encoder=CLIP-L, Training Regime=Training-Based2026.02 | 53.3 | |
| Video-LLaMA2LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 51.7 | |
| Video-LLaMA2LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 51.7 | |
| MoReVQALLM=PaLM-22024.06 | 51.7 | |
| VideoLLaMA2-7Bzero-shot=true2025.03 | 51.7 | |
| KTV-7B-denseLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=dense2026.02 | 51 | |
| KTV-7B-normalLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=normal2026.02 | 50.4 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 50.3 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 50.3 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 50.3 | |
| LLoViLLM=GPT-3.52024.06 | 50.3 | |
| TS-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 50.2 | |
| TS-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 50.2 | |
| KTV-7B-sparseLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=sparse2026.02 | 49.6 | |
| DYTOLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 48.6 | |
| VamosLLM=GPT-42024.06 | 48.3 | |
| SF-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 47.2 | |
| SF-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 47.2 | |
| SF-LLaVA-7BLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 44.2 | |
| DeepStack-LLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 38.4 | |
| DeepStack-LLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 38.4 | |
| MVULLM=Mistral-13B2024.06 | 37.6 | |
| Video-LLaVALLM Size=7B, Vision Encoder=ViT-L, Training Strategy=Video-trained2024.11 | 37 | |
| Video-LLaVALLM Size=7B, Vision Encoder=ViT-L, Training Strategy=Video-trained2024.11 | 37 | |
| M3LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 36.8 | |
| M3LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 36.8 | |
| IG-VLMLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 35.8 | |
| IG-VLMLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 35.8 | |
| IG-VLMLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 35.8 |