Video Question Answering on Causal-VidQA
76.22AccuracyQwenVL 2.5-7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| QwenVL 2.5-7BCategory=VLMs/Multimodal foundation approaches2025.08 | 76.22 | 59.5 | 70.73 | |
| OursCategory=VLMs/Multimodal foundation approaches2025.08 | 76.18 | 69.26 | 71.22 | |
| MISTCategory=Semi-traditional approaches2025.08 | 72.41 | 57.36 | 64.04 | |
| VILA 1.5-3BCategory=VLMs/Multimodal foundation approaches2025.08 | 72.11 | 65.05 | 67.2 | |
| MCR+HCRNCategory=Causal modeling approaches2025.08 | 66 | — | — | |
| VCSRCategory=Causal modeling approaches2025.08 | 65.41 | — | — | |
| HGACategory=Traditional VideoQA approaches2025.08 | 63.51 | 42 | 53.88 | |
| CoMemCategory=Traditional VideoQA approaches2025.08 | 62.79 | 40.94 | 53.05 | |
| BLIP-2Category=VLMs/Multimodal foundation approaches2025.08 | 62 | 43.44 | 53 | |
| HCRNCategory=Traditional VideoQA approaches2025.08 | 61.61 | 41.86 | 52.93 | |
| HMECategory=Traditional VideoQA approaches2025.08 | 61.45 | 40.66 | 52.43 | |
| EVQACategory=Traditional VideoQA approaches2025.08 | 60.95 | 38.91 | 50.62 | |
| BlindQACategory=Traditional VideoQA approaches2025.08 | 59.46 | 33.64 | 44.87 | |
| DeepSeek-VL2Category=VLMs/Multimodal foundation approaches2025.08 | 57.08 | 41.92 | 51.95 | |
| GPT4oCategory=VLMs/Multimodal foundation approaches2025.08 | 52 | 56.72 | 58 | |
| TraveLERZero-shot=true2024.04 | 47.5 | — | — | |
| VideoChat2Category=VLMs/Multimodal foundation approaches2025.08 | 46 | 40.45 | 48.5 | |
| VideoLLaMACategory=VLMs/Multimodal foundation approaches2025.08 | 31 | 28.24 | 33.31 | |
| CaKE + HGAZero-shot=true2024.04 | 30.6 | — | — | |
| CaKE + CoMemZero-shot=true2024.04 | 30 | — | — | |
| Just-AskZero-shot=true2024.04 | 27.1 | — | — |