Multiple Choice VideoQA on IntentQA
68AccuracyKTV-34B-dense
Evaluation Results
| Method | Links | |
|---|---|---|
| KTV-34B-denseLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=dense2026.02 | 68 | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 67.9 | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 67.9 | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 67.9 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Protocol=Training-free2024.07 | 66.9 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 66.9 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 66.9 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 66.9 | |
| KTV-34B-normalLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=normal2026.02 | 66.6 | |
| SF-LLaVA-34BLLM Size=34B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 66.5 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 66.5 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 66.5 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 66.5 | |
| DYTOLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 66.4 | |
| SF-LLaVA-7BLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 66.1 | |
| KTV-34B-sparseLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=sparse2026.02 | 65.9 | |
| IG-VLM (LLaVA-v1.6)LLM Size=34B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 65.3 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 65.3 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 65.3 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 65.3 | |
| IG-VLMLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 64.5 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Protocol=Training-free2024.07 | 64 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 64 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 64 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 64 | |
| KTV-7B-denseLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=dense2026.02 | 62 | |
| TS-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 61.7 | |
| TS-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 61.7 | |
| DYTOLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 61.6 | |
| KTV-7B-normalLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=normal2026.02 | 61.3 | |
| KTV-7B-sparseLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=sparse2026.02 | 61.2 | |
| SF-LLaVA-7BLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 60.5 | |
| IG-VLM (LLaVA-v1.6)LLM Size=7B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 60.3 | |
| IG-VLMLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 60.3 | |
| IG-VLMLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 60.3 | |
| IG-VLMLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 60.3 | |
| SF-LLaVA-7BLLM Size=7B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 60.1 | |
| SF-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 60.1 | |
| SF-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 60.1 | |
| M3LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 58.8 | |
| M3LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 58.8 |