Open-Ended VideoQA on ANet-QA
64.4AccuracyLLaVA-NeXT-Video-DPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLaVA-NeXT-Video-DPOLLM Size=34B, Vision Encoder=CLIP-L2024.07 | 64.4 | 3.6 | |
| LLaVA-NeXT-Video-DPOLLM Size=34B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 64.4 | 3.6 | |
| PLLaVALLM Size=34B, Vision Encoder=CLIP-L2024.07 | 60.9 | 3.7 | |
| PLLAVALLM Size=34B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 60.9 | 3.7 | |
| LLaVA-NeXT-Video-DPOLLM Size=7B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 60.2 | 3.5 | |
| SF-LLaVA-34BLLM Size=34B, Vision Encoder=CLIP-L2024.07 | 59.2 | 3.5 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 59.2 | 3.5 | |
| TS-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 58.9 | 3.5 | |
| LLaVA-NeXT-VideoLLM Size=34B, Vision Encoder=CLIP-L2024.07 | 58.8 | 3.4 | |
| LLaVA-NeXT-VideoLLM Size=34B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 58.8 | 3.4 | |
| IG-VLM (LLaVA-v1.6)LLM Size=34B, Vision Encoder=CLIP-L2024.07 | 58.4 | 3.5 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 58.4 | 3.5 | |
| TS-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 56.7 | 3.4 | |
| PLLAVALLM Size=7B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 56.3 | 3.5 | |
| LLaVA-NeXT-ImageLLM Size=34B, Vision Encoder=CLIP-L2024.07 | 55.6 | 3.3 | |
| LLaVA-NeXT-ImageLLM Size=34B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 55.6 | 3.3 | |
| SF-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 55.5 | 3.4 | |
| IG-VLMLLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 54.3 | 3.4 | |
| LLaVA-NeXT-ImageLLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 53.8 | 3.2 | |
| LLaVA-NeXT-VideoLLM Size=7B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 53.5 | 3.2 | |
| FreeVALLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 51.2 | 3.5 | |
| VideoGPT+LLM Size=3.8B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 50.6 | 3.6 | |
| Video-LLaMA2LLM Size=46.7B, Vision Encoder=CLIP-L2024.07 | 50.3 | 3.4 | |
| Video-LLaMA2LLM Size=7B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 50.2 | 3.3 | |
| DeepStack-LLLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 49.3 | 3.1 | |
| VideoChat2LLM Size=7B, Vision Encoder=UMT-L, Training-free=false2024.11 | 49.1 | 3.3 | |
| Vista-LLaMALLM Size=7B, Vision Encoder=CLIP-G, Training-free=false2024.11 | 48.3 | 3.3 | |
| MovieChat+LLM Size=7B, Vision Encoder=CLIP-G, Training-free=false2024.11 | 48.1 | 3.4 | |
| LLaMA-VIDLLM Size=13B, Vision Encoder=CLIP-G, Training-free=false2024.11 | 47.4 | 3.3 | |
| MovieChatLLM Size=7B, Vision Encoder=CLIP-G, Training-free=false2024.11 | 45.7 | 3.4 | |
| Video-LLaVALLM Size=7B, Vision Encoder=ViT-L, Training-free=false2024.11 | 45.3 | 3.3 | |
| Video-ChatGPTLLM Size=7B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 35.2 | 2.7 | |
| VideoChatLLM Size=7B, Vision Encoder=CLIP-G, Training-free=false2024.11 | 26.5 | 2.2 | |
| Video-LLaMALLM Size=7B, Vision Encoder=CLIP-G, Training-free=false2024.11 | 12.4 | 1.1 |