Visual Question Answering on VQA ITA
48AccuracyLLaVA-1.5
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-1.5Image Encoder=OpenAI CLIP ViT-L/14, Params=7B, LLM-as-Judge=GPT-4o2026.01 | 48 | |
| InstructBLIP (FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, Params=4.1B, LLM-as-Judge=GPT-4o2026.01 | 44 | |
| LLaVA-1.6Image Encoder=OpenAI CLIP ViT-L/14, Params=7B, LLM-as-Judge=GPT-4o2026.01 | 43 | |
| BLIP-2 (FlanT5XL ViT-L)Image Encoder=OpenAI CLIP ViT-L/14, Params=3.4B, LLM-as-Judge=GPT-4o2026.01 | 38 | |
| BLIP-2 (FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, Params=4.1B, LLM-as-Judge=GPT-4o2026.01 | 33 | |
| OpenFlamingoImage Encoder=OpenAI CLIP ViT-L/14, Params=3B, LLM-as-Judge=GPT-4o2026.01 | 19 |