Video Question Answering on MSVD-QA zero-shot (test)
81.5AccuracyLLaVA+FreeVA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLaVA+FreeVALLM Size=7B, GPT-3.5 Version=MAR, Train Free=true2024.05 | 81.5 | 4 | |
| LinVT-Qwen2-VLSize=7B, Zero-shot=true2024.12 | 80.2 | 4.4 | |
| LinVT-InternVL2Size=8B, Zero-shot=true2024.12 | 79.3 | 4.4 | |
| SlowFast-LLaVASize=7B, Zero-shot=true2024.12 | 79.1 | 4.1 | |
| LinVT-BLIP-3Size=4B, Zero-shot=true2024.12 | 79.1 | 4.4 | |
| LinVT-MolmoSize=7B, Zero-shot=true2024.12 | 78.1 | 4.3 | |
| BLIP-3-VideoSize=4B, Zero-shot=true2024.12 | 77.7 | 4.2 | |
| DC+FreeVALLM Size=34B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 77.4 | 4.2 | |
| TarsierSize=7B, Zero-shot=true2024.12 | 77 | 4.1 | |
| PLLaVASize=7B, Zero-shot=true2024.12 | 76.6 | 4.1 | |
| DC+FreeVALLM Size=13B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 75.1 | 4.1 | |
| DC+FreeVALLM Size=7B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 75 | 4.1 | |
| DynFocusSize=7B, Zero-shot=true, GPT-Version=Turbo-06132024.11 | 74.8 | 4 | |
| VaQuitALLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 74.6 | 3.7 | |
| LinVT-AquilaSize=2B, Zero-shot=true2024.12 | 74.6 | 4.1 | |
| ST-LLMSize=7B, Zero-shot=true2024.11 | 74.6 | 3.9 | |
| LLaVA+FreeVALLM Size=13B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 74.4 | 4.1 | |
| MiniGPT4-VideoSize=7B, Zero-shot=true2024.12 | 73.9 | 4.1 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=336, Image Token=8, Vision Compression=true, Zero-shot=true2024.06 | 73.5 | 3.9 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=8, Vision Compression=true, Zero-shot=true2024.06 | 73.4 | 3.9 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=336, Image Token=2, Vision Compression=true, Zero-shot=true2024.06 | 72.6 | 3.9 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=2, Vision Compression=true, Zero-shot=true2024.06 | 72.3 | 3.9 | |
| DynFocusSize=7B, Zero-shot=true, GPT-Version=Turbo-16k2024.11 | 72.3 | 3.9 | |
| LLaVA+FreeVALLM Size=13B, GPT-3.5 Version=JUN, Train Free=true2024.05 | 71.8 | 3.8 | |
| Video-LLaVASize=7B, Zero-shot=true2024.12 | 71.8 | 3.9 | |
| Video-LLaMA2Size=7B, Zero-shot=true2024.12 | 71.7 | 3.9 | |
| LinVT-MiphaSize=1.6B, Zero-shot=true2024.12 | 71.2 | 3.8 | |
| Video-LLaVALLM Size=7B, GPT-3.5 Version=JUN, Train Free=false2024.05 | 70.7 | 3.9 | |
| LLaMA-VIDLLM Size=13B, GPT-3.5 Version=JUN, Train Free=false2024.05 | 70 | 3.7 | |
| LLAMA-VIDSize=13B, Zero-shot=true2024.11 | 70 | 3.7 | |
| VideoChat2Size=7B, Zero-shot=true2024.11 | 70 | 3.9 | |
| LLaMA-VIDSize=7B, Zero-shot=true2024.12 | 69.7 | 3.7 | |
| LLaMA-VIDVisual Encoder=EVA-G, LLM=Vicuna-7B, Resolution=224, Image Token=2, Vision Compression=true, Zero-shot=true2024.06 | 69.7 | 3.7 | |
| LLAMA-VIDSize=7B, Zero-shot=true2024.11 | 69.7 | 3.7 | |
| Chat-UniViSize=7B, Zero-shot=true2024.12 | 69.3 | 3.7 | |
| Chat-UniViVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 69.3 | 3.7 | |
| BT-AdapterLLM Size=7B, GPT-3.5 Version=JUN, Train Free=false2024.05 | 67.5 | 3.7 | |
| BT-AdapterVisual Encoder=CLIP-L, LLM=Vicuna-7B, Vision Compression=false, Zero-shot=true2024.06 | 67.5 | 3.7 | |
| BT-AdapterSize=7B, Zero-shot=true2024.11 | 67.5 | 3.7 | |
| Vista-LLaMAVisual Encoder=EVA-G, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 65.3 | 3.6 | |
| Chat-UniViSize=7B, Zero-shot=true2024.11 | 65 | 3.6 | |
| Video-ChatGPTLLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 64.9 | 3.3 | |
| Video-ChatGPTSize=7B, Zero-shot=true2024.12 | 64.9 | 3.3 | |
| Video-ChatGPTVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 64.9 | 3.3 | |
| VideoChatGPTSize=7B, Zero-shot=true2024.11 | 64.9 | 3.3 | |
| VideoChatLLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 56.3 | 2.8 | |
| VideoChatSize=7B, Zero-shot=true2024.12 | 56.3 | 2.8 | |
| VideoChatLLM=Vicuna-7B, Resolution=224, Vision Compression=false, Zero-shot=true2024.06 | 56.3 | 2.8 | |
| VideoChatSize=7B, Zero-shot=true2024.11 | 56.3 | 2.8 | |
| LLaMA-AdapterSize=7B, Zero-shot=true2024.11 | 54.9 | 3.1 | |
| Video-LLaMALLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 51.6 | 2.5 | |
| Video-LLaMASize=7B, Zero-shot=true2024.12 | 51.6 | 2.5 | |
| Video-LLaMAVisual Encoder=EVA-G, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 51.6 | 2.5 | |
| VideoLLaMASize=7B, Zero-shot=true2024.11 | 51.6 | 2.5 | |
| FrozenBiLMLLM Size=0.9B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 33.8 | — | |
| FrozenBiLMVisual Encoder=CLIP-L, LLM=DeVERTa-V2, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 32.3 | — |