Video Question Answering on MSVD (test)
76.4AccuracyDivot-LLM
Evaluation Results
| Method | Links | |
|---|---|---|
| Divot-LLMLLM size=7B, Video-Gen=true2024.12 | 76.4 | |
| VILA-ULLM size=7B, Video-Gen=true2024.12 | 75.3 | |
| Video-LaVITLLM size=7B, Video-Gen=true2024.12 | 73.2 | |
| VideoLLaMA2LLM size=72B, Video-Gen=false2024.12 | 71 | |
| VideoLLaMA2LLM size=7B, Video-Gen=false2024.12 | 70.9 | |
| Video-LLaVALLM size=7B, Video-Gen=false2024.12 | 70.7 | |
| VideoChat2LLM size=7B, Video-Gen=false2024.12 | 70 | |
| LLaMA-VIDLLM size=7B, Video-Gen=false2024.12 | 69.7 | |
| LLaVA-NeXT-VideoLLM size=7B, Video-Gen=false2024.12 | 67.8 | |
| Video-ChatGPTLLM size=7B, Video-Gen=false2024.12 | 64.9 | |
| LWMLLM size=7B, Video-Gen=true2024.12 | 55.9 | |
| X2-VLM (large)# Params=593M, mode=fine-tuning2022.11 | 54.6 | |
| X2-VLM (base)# Params=255M, mode=fine-tuning2022.11 | 52.8 | |
| OmniVL# Params=288M, mode=fine-tuning2022.11 | 51 | |
| OmniVLPreTrain VLData=18M2024.03 | 51 | |
| VIOLET# Params=163M, mode=fine-tuning2022.11 | 47.9 | |
| All-in-one# Params=110M, mode=fine-tuning2022.11 | 47.9 | |
| OmniViD2024.03 | 47.7 | |
| JustAskPreTrain VLData=69M2024.03 | 46.3 | |
| ALPRO# Params=513M, mode=fine-tuning2022.11 | 45.9 | |
| ALIPROPreTrain VLData=5.5M2024.03 | 45.9 | |
| VA³Backbone=HQGA2024.07 | 44.46 | |
| CoMVTPreTrain VLData=100M2024.03 | 42.6 | |
| VA³Backbone=HGA2024.07 | 41.24 | |
| HQGA2024.07 | 41.23 | |
| JustAsk2024.03 | 41.2 | |
| VA³Backbone=HME2024.07 | 38.51 | |
| HGA2024.07 | 36.71 | |
| HCRN2024.03 | 36.1 | |
| HME2024.07 | 33.75 |