Image Captioning on COCO (GPT-4 Consistency vs Perturbations)
78.6GPT-4 Consistency (Clean)LLaVA-1.5
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| LLaVA-1.5Image Encoder=OpenAI CLIP ViT-L/14, Params=7B2026.03 | 78.6 | 77 | 74.6 | 63.73 | 46.4 | |
| InstructBLIP(FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, Params=4.1B2026.03 | 76.5 | 72.07 | 69.77 | 63.2 | 40.9 | |
| BLIP-2(FlanT5XL ViT-L)Image Encoder=EVA-CLIP ViT-G/14, Params=3.4B2026.03 | 75.1 | 70.77 | 68.57 | 60.93 | 21.9 | |
| BLIP-2(FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, Params=4.1B2026.03 | 74.96 | 71.27 | 68.8 | 62.01 | 59 | |
| LLaVA-1.6Image Encoder=OpenAI CLIP ViT-L/14, Params=7B2026.03 | 72.1 | 71.7 | 71.17 | 61.6 | 44.2 | |
| OpenFlamingoImage Encoder=EVA-CLIP ViT-G/14, Params=3B2026.03 | 70.2 | 69.53 | 67.8 | 53.93 | 11.6 |