Video Question Answering on ANetQA (oe)
56.6AccuracyLLAVA-OV
Evaluation Results
| Method | Links | |
|---|---|---|
| LLAVA-OVLLM=Qwen2-7B, Vision Encoder=SigLIP-SO400M2024.12 | 56.6 | |
| LLaVA-VideoLLM=Qwen2-7B, Vision Encoder=SigLIP-SO400M2024.12 | 56.5 | |
| LLaVA-NeXT-INST-ITLLM=Qwen2-7B, Vision Encoder=SigLIP-SO4002024.12 | 55.2 | |
| LLaVA-NeXTLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large, baseline=true2024.12 | 53.8 | |
| LLaVA-NeXT-INST-ITLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 53.7 | |
| LLaVA-Next-VideoLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 53.5 | |
| VideoLLaMA2LLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 50.2 | |
| DeepStack-LLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 49.3 | |
| Video-ChatGPTLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 35.2 |