Video Question Answering on SEED-Bench Video
53.2AccuracyIDEFICS-80B
Evaluation Results
| Method | Links | |
|---|---|---|
| IDEFICS-80BLLM=LLaMA-65B, Image Size=224x224, Pre-train Sample Size=353M, Fine-tune Sample Size=1M2023.10 | 53.2 | |
| IDEFICS-9BLLM=LLAMA-7B, Image Size=224x224, Pre-train Sample Size=353M, Fine-tune Sample Size=1M2023.10 | 44.5 | |
| LLaVA-1.5-13BLLM=Vicuna-13B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 42.7 | |
| LLaVA-1.5-13B-HDLLM=Vicuna-13B, Image Size=448x448, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 41.3 | |
| Qwen-VLLLM=Qwen-7B, Image Size=448x448, Pre-train Sample Size=1.4B+, Fine-tune Sample Size=50M+2023.10 | 39.1 | |
| InstructBLIP-8BLLM=Vicuna-7B, Image Size=224x224, Pre-train Sample Size=129M, Fine-tune Sample Size=1.2M2023.10 | 38.1 | |
| Qwen-VL-ChatLLM=Qwen-7B, Image Size=448x448, Pre-train Sample Size=1.4B*, Fine-tune Sample Size=50M+2023.10 | 37.8 | |
| LLaVA-1.5-7BLLM=Vicuna-7B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 37.3 | |
| BLIP2-14BLLM=Vicuna-13B, Image Size=224x224, Pre-train Sample Size=129M2023.10 | 36.7 | |
| LLaVA-7BLLM=Vicuna-7B2023.10 | 23.8 |