Video Question Answering on ActivityNet-QA zero-shot (test)
60.1AccuracyLinVT-Qwen2-VL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LinVT-Qwen2-VLSize=7B, Zero-shot=true2024.12 | 60.1 | 3.6 | |
| LinVT-InternVL2Size=8B, Zero-shot=true2024.12 | 59.7 | 3.7 | |
| LinVT-MolmoSize=7B, Zero-shot=true2024.12 | 59.6 | 3.7 | |
| TarsierSize=7B, Zero-shot=true2024.12 | 59.5 | 3.6 | |
| LinVT-BLIP-3Size=4B, Zero-shot=true2024.12 | 58.9 | 3.6 | |
| LLaVA+FreeVALLM Size=7B, GPT-3.5 Version=MAR, Train Free=true2024.05 | 58.3 | 3.5 | |
| PLLaVASize=7B, Zero-shot=true2024.12 | 56.3 | 3.5 | |
| SlowFast-LLaVASize=7B, Zero-shot=true2024.12 | 56.3 | 3.4 | |
| DC+FreeVALLM Size=34B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 55.8 | 3.6 | |
| BLIP-3-VideoSize=4B, Zero-shot=true2024.12 | 55.7 | 3.5 | |
| LLaVA+FreeVALLM Size=13B, GPT-3.5 Version=JUN, Train Free=true2024.05 | 54.5 | 3.5 | |
| DC+FreeVALLM Size=13B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 52.6 | 3.5 | |
| DC+FreeVALLM Size=7B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 52.2 | 3.5 | |
| LLaVA+FreeVALLM Size=13B, GPT-3.5 Version=JAN, Train Free=true2024.05 | 51.6 | 3.5 | |
| LinVT-AquilaSize=2B, Zero-shot=true2024.12 | 51.1 | 3.3 | |
| ST-LLMSize=7B, Zero-shot=true2024.11 | 50.9 | 3.3 | |
| DynFocusSize=7B, Zero-shot=true, GPT-Version=Turbo-06132024.11 | 50.3 | 3.4 | |
| Video-LLaMA2Size=7B, Zero-shot=true2024.12 | 49.9 | 3.3 | |
| DynFocusSize=7B, Zero-shot=true, GPT-Version=Turbo-16k2024.11 | 49.4 | 3.4 | |
| VideoChat2Size=7B, Zero-shot=true2024.11 | 49.1 | 3.3 | |
| VideoChat2Fine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 49.1 | 3.3 | |
| VaQuitALLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 48.8 | 3.3 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=336, Image Token=8, Vision Compression=true, Zero-shot=true2024.06 | 48.6 | 3.4 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=8, Vision Compression=true, Zero-shot=true2024.06 | 48.5 | 3.4 | |
| Vista-LLaMAVisual Encoder=EVA-G, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 48.3 | 3.3 | |
| Oracle-RLAIFFine-tuning method=RLAIF (GRPOrank), Evaluation Mode=Zero-shot2025.10 | 48 | 3.5 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=2, Vision Compression=true, Zero-shot=true2024.06 | 47.9 | 3.4 | |
| VoCo-LLaMAVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=336, Image Token=2, Vision Compression=true, Zero-shot=true2024.06 | 47.9 | 3.4 | |
| LLaMA-VIDLLM Size=13B, GPT-3.5 Version=JUN, Train Free=false2024.05 | 47.5 | 3.3 | |
| LinVT-MiphaSize=1.6B, Zero-shot=true2024.12 | 47.5 | 3.1 | |
| LLAMA-VIDSize=13B, Zero-shot=true2024.11 | 47.5 | 3.3 | |
| LLaMA-VIDSize=7B, Zero-shot=true2024.12 | 47.4 | 3.3 | |
| LLaMA-VIDVisual Encoder=EVA-G, LLM=Vicuna-7B, Resolution=224, Image Token=2, Vision Compression=true, Zero-shot=true2024.06 | 47.4 | 3.3 | |
| LLAMA-VIDSize=7B, Zero-shot=true2024.11 | 47.4 | 3.3 | |
| LLaMA-VIDFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 47.4 | 3.23 | |
| MiniGPT4-VideoSize=7B, Zero-shot=true2024.12 | 46.3 | 3.4 | |
| Chat-UniViSize=7B, Zero-shot=true2024.12 | 46.1 | 3.3 | |
| Chat-UniViVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 46.1 | 3.3 | |
| VLM-RLAIFFine-tuning method=RLAIF (PPO), Evaluation Mode=Zero-shot2025.10 | 46.1 | 3.4 | |
| Chat-UniViSize=7B, Zero-shot=true2024.11 | 45.8 | 3.2 | |
| BT-AdapterLLM Size=7B, GPT-3.5 Version=JUN, Train Free=false2024.05 | 45.7 | 3.2 | |
| BT-AdapterVisual Encoder=CLIP-L, LLM=Vicuna-7B, Vision Compression=false, Zero-shot=true2024.06 | 45.7 | 3.2 | |
| BT-AdapterSize=7B, Zero-shot=true2024.11 | 45.7 | 3.2 | |
| BT-AdapterFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 45.7 | 3.2 | |
| Video-LLaVALLM Size=7B, GPT-3.5 Version=JUN, Train Free=false2024.05 | 45.3 | 3.3 | |
| Video-LLaVASize=7B, Zero-shot=true2024.12 | 45.3 | 3.3 | |
| Video-LLaVAFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 45.3 | 3.3 | |
| VLM-SFTFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 44.1 | 3.2 | |
| Oracle-DPOFine-tuning method=RLAIF (DPO), Evaluation Mode=Zero-shot2025.10 | 40.1 | 2.9 | |
| Video-ChatGPTLLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 35.2 | 2.7 | |
| Video-ChatGPTVisual Encoder=CLIP-L, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 35.2 | 2.7 | |
| VideoChatGPTSize=7B, Zero-shot=true2024.11 | 35.2 | 2.7 | |
| Video-ChatGPTFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 35.2 | 2.7 | |
| Video-ChatGPTSize=7B, Zero-shot=true2024.12 | 34.2 | 2.8 | |
| LLaMA-AdapterSize=7B, Zero-shot=true2024.11 | 34.2 | 2.7 | |
| VideoChatLLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 26.5 | 2.2 | |
| VideoChatLLM=Vicuna-7B, Resolution=224, Vision Compression=false, Zero-shot=true2024.06 | 26.5 | 2.2 | |
| VideoChatSize=7B, Zero-shot=true2024.11 | 26.5 | 2.2 | |
| FrozenBiLMLLM Size=0.9B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 25.9 | — | |
| FrozenBiLMVisual Encoder=CLIP-L, LLM=DeVERTa-V2, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 24.7 | — | |
| Video-LLaMALLM Size=7B, GPT-3.5 Version=MAR, Train Free=false2024.05 | 12.4 | 1.1 | |
| Video-LLaMASize=7B, Zero-shot=true2024.12 | 12.4 | 1.1 | |
| Video-LLaMAVisual Encoder=EVA-G, LLM=Vicuna-7B, Resolution=224, Image Token=256, Vision Compression=false, Zero-shot=true2024.06 | 12.4 | 1.1 | |
| VideoLLaMASize=7B, Zero-shot=true2024.11 | 12.4 | 1.1 | |
| VideoLLaMAFine-tuning method=SFT, Evaluation Mode=Zero-shot2025.10 | 12.4 | 1.1 | |
| VideoChatSize=7B, Zero-shot=true2024.12 | — | 2.2 |