Video Question Answering on MSRVTT-QA zero-shot (test)
72.9AccuracyLLaVA+FreeVA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLaVA+FreeVALLM Size=7B, GPT-3.5 Version=MAR, Train Free=true2024.05 | 72.9 | 3.5 | |
| VaQuitALLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 68.6 | 3.3 | |
| LinVT-Qwen2-VLSize=7B, Zero-shot=true2024.12 | 66.2 | 4 | |
| SlowFast-LLaVASize=7B, Zero-shot=true2024.12 | 65.8 | 3.6 | |
| ST-LLMSize=7B, Zero-shot=true2024.11 | 63.2 | 3.4 | |
| LinVT-InternVL2Size=8B, Zero-shot=true2024.12 | 63.1 | 4 | |
| DynFocusSize=7B, Zero-shot=true, GPT-Version=Turbo-06132024.11 | 62.8 | 3.6 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=336, Image Token=8, Vision Compression=true, Zero-shot=true2024.06 | 62.3 | 3.5 | |
| DC+FreeVALLM Size=34B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 62.1 | 3.6 | |
| PLLaVASize=7B, Zero-shot=true2024.12 | 62 | 3.5 | |
| TarsierSize=7B, Zero-shot=true2024.12 | 62 | 3.5 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=8, Vision Compression=true, Zero-shot=true2024.06 | 62 | 3.5 | |
| LinVT-BLIP-3Size=4B, Zero-shot=true2024.12 | 61.5 | 3.9 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=336, Image Token=2, Vision Compression=true, Zero-shot=true2024.06 | 61.2 | 3.5 | |
| LLaVA+FreeVALLM Size=13B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 61.1 | 3.6 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=2, Vision Compression=true, Zero-shot=true2024.06 | 61.1 | 3.5 | |
| DC+FreeVALLM Size=13B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 60.8 | 3.5 | |
| Oracle-RLAIFFine-tuning method=RLAIF (GRPOrank), Evaluation Mode=Zero-shot2025.10 | 60.8 | 3.8 | |
| Vista-LLaMAVisual Encoder=EVA-G, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 60.5 | 3.3 | |
| LinVT-MolmoSize=7B, Zero-shot=true2024.12 | 60.3 | 3.7 | |
| BLIP-3-VideoSize=4B, Zero-shot=true2024.12 | 60 | 3.6 | |
| DynFocusSize=7B, Zero-shot=true, GPT-Version=Turbo-16k2024.11 | 59.8 | 3.4 | |
| MiniGPT4-VideoSize=7B, Zero-shot=true2024.12 | 59.7 | 3.3 | |
| Video-LLaVALLM Size=7B, GPT-3.5 Version=JUN, Train Free=false2024.05 | 59.2 | 3.5 | |
| LLaVA+FreeVALLM Size=13B, GPT-3.5 Version=JUN, Train Free=true2024.05 | 59.2 | 3.3 | |
| Video-LLaVASize=7B, Zero-shot=true2024.12 | 59.2 | 3.5 | |
| Video-LLaVAFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 59.2 | 3.5 | |
| LLaMA-VIDLLM Size=13B, GPT-3.5 Version=JUN, Train Free=false2024.05 | 58.9 | 3.3 | |
| LLAMA-VIDSize=13B, Zero-shot=true2024.11 | 58.9 | 3.3 | |
| DC+FreeVALLM Size=7B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 58.4 | 3.5 | |
| LinVT-AquilaSize=2B, Zero-shot=true2024.12 | 58.4 | 3.2 | |
| LLaMA-VIDSize=7B, Zero-shot=true2024.12 | 57.7 | 3.2 | |
| LLaMA-VIDVisual Encoder=EVA-G, LLM=Vicuna-7B, Resolution=224, Image Token=2, Vision Compression=true, Zero-shot=true2024.06 | 57.7 | 3.2 | |
| LLAMA-VIDSize=7B, Zero-shot=true2024.11 | 57.7 | 3.2 | |
| LLaMA-VIDFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 57.7 | 3.2 | |
| BT-AdapterLLM Size=7B, GPT-3.5 Version=JUN, Train Free=false2024.05 | 57 | 3.2 | |
| BT-AdapterVisual Encoder=CLIP-L, LLM=Vicuna-7B, Vision Compression=false, Zero-shot=true2024.06 | 57 | 3.2 | |
| BT-AdapterSize=7B, Zero-shot=true2024.11 | 57 | 3.2 | |
| BT-AdapterFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 57 | 3.2 | |
| LinVT-MiphaSize=1.6B, Zero-shot=true2024.12 | 55.3 | 3 | |
| Chat-UniViSize=7B, Zero-shot=true2024.12 | 55 | 3.1 | |
| Chat-UniViVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 55 | 3.1 | |
| Chat-UniViSize=7B, Zero-shot=true2024.11 | 54.6 | 3.1 | |
| VLM-RLAIFFine-tuning method=RLAIF (PPO), Evaluation Mode=Zero-shot2025.10 | 54.2 | 3.1 | |
| VideoChat2Size=7B, Zero-shot=true2024.11 | 54.1 | 3.3 | |
| VideoChat2Fine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 54.1 | 3.3 | |
| Oracle-DPOFine-tuning method=RLAIF (DPO), Evaluation Mode=Zero-shot2025.10 | 53.2 | 3.1 | |
| VLM-SFTFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 52.4 | 3 | |
| Video-ChatGPTLLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 49.3 | 2.8 | |
| Video-ChatGPTSize=7B, Zero-shot=true2024.12 | 49.3 | 2.8 | |
| Video-ChatGPTVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 49.3 | 2.8 | |
| VideoChatGPTSize=7B, Zero-shot=true2024.11 | 49.3 | 2.8 | |
| Video-ChatGPTFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 49.3 | 2.9 | |
| VideoChatLLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 45 | 2.5 | |
| VideoChatSize=7B, Zero-shot=true2024.12 | 45 | 2.5 | |
| VideoChatLLM=Vicuna-7B, Resolution=224, Vision Compression=false, Zero-shot=true2024.06 | 45 | 2.5 | |
| VideoChatSize=7B, Zero-shot=true2024.11 | 45 | 2.5 | |
| LLaMA-AdapterSize=7B, Zero-shot=true2024.11 | 43.8 | 2.7 | |
| Video-LLaMALLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 29.6 | 1.8 | |
| Video-LLaMASize=7B, Zero-shot=true2024.12 | 29.6 | 1.8 | |
| Video-LLaMAVisual Encoder=EVA-G, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 29.6 | 1.8 | |
| VideoLLaMASize=7B, Zero-shot=true2024.11 | 29.6 | 1.8 | |
| VideoLLaMAFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 29.6 | 1.8 | |
| FrozenBiLMVisual Encoder=CLIP-L, LLM=DeVERTa-V2, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 16.8 | — | |
| FrozenBiLMLLM Size=0.9B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 16.7 | — |