Visual Question Answering on VQA Shadow
0.67AccuracyLLaVA-1.5
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-1.5Image Encoder=OpenAI CLIP ViT-L/14, Params=7B, LLM-as-Judge=GPT-4o2026.01 | 0.67 | |
| LLaVA-1.6Image Encoder=OpenAI CLIP ViT-L/14, Params=7B, LLM-as-Judge=GPT-4o2026.01 | 0.64 | |
| InstructBLIP (FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, Params=4.1B, LLM-as-Judge=GPT-4o2026.01 | 0.62 | |
| BLIP-2 (FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, Params=4.1B, LLM-as-Judge=GPT-4o2026.01 | 0.54 | |
| BLIP-2 (FlanT5XL ViT-L)Image Encoder=OpenAI CLIP ViT-L/14, Params=3.4B, LLM-as-Judge=GPT-4o2026.01 | 0.5 | |
| OpenFlamingoImage Encoder=OpenAI CLIP ViT-L/14, Params=3B, LLM-as-Judge=GPT-4o2026.01 | 0.44 |