Visual Question Answering on INST-IT Bench Image
84.8MC AccuracyGPT-4o
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4o#IT=N/A2024.12 | 84.8 | 74.1 | |
| Gemini-1.5-flash#IT=N/A2024.12 | 79.5 | 65.3 | |
| LLaVA-NeXT-INST-ITLLM=Qwen2-7B, #IT=920K2024.12 | 75.3 | 67.9 | |
| Qwen2-VL-InstructLLM=Qwen2-72B, #IT=N/A2024.12 | 74.7 | 55.5 | |
| LLaVA-OVLLM=Qwen2-7B, #IT=~8.8M2024.12 | 71.7 | 48 | |
| LLaVA-VideoLLM=Qwen2-7B, #IT=~7.4M2024.12 | 67 | 45.1 | |
| InternVL2LLM=InternLM2.5-7B, #IT=N/A2024.12 | 66.5 | 58.6 | |
| LLaVA-NeXT-INST-ITLLM=Vicuna-7B, #IT=920K2024.12 | 63 | 68.6 | |
| LLaVA-OV (SI)LLM=Qwen2-7B, #IT=~7.2M2024.12 | 61.8 | 60.3 | |
| ShareGPT4VideoLLM=Llama3-8B, #IT=~1.0M2024.12 | 48.7 | 43.2 | |
| LLaVA-NeXTLLM=Vicuna-7B, #IT=765K2024.12 | 42.4 | 46 | |
| SoM-LLaVALLM=Vicuna-7B, #IT=695K2024.12 | 40 | 45.1 | |
| LLaVA-NeXT-VideoLLM=Vicuna-7B, #IT=860K2024.12 | 39.5 | 46.5 | |
| LLaVA-1.5LLM=Vicuna-7B, #IT=665K2024.12 | 32.1 | 41.6 | |
| ViP-LLaVALLM=Vicuna-7B, #IT=~1.2M2024.12 | 29.2 | 42.1 | |
| Random Guess#IT=N/A2024.12 | 25 | — |