Image Captioning on COCO (Consistency & Attack Degradation Metrics)
78.6Clean ConsistencyLLaVA-1.5
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| LLaVA-1.5Image Encoder=OpenAI CLIP ViT-L/14, #Params=7B2026.04 | 78.6 | 77 | 1.63 | 74.6 | 4 | 63.73 | 14.87 | 56.23 | 22.37 | |
| InstructBLIP (FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, #Params=4.1B2026.04 | 76.5 | 72.07 | 4.43 | 69.77 | 6.73 | 63.2 | 13.3 | 59.43 | 17.07 | |
| Blip-2 (FlanT5XL ViT-L)Image Encoder=OpenAI CLIP ViT-L/14, #Params=3.4B2026.04 | 75.1 | 70.77 | 4.33 | 68.57 | 6.53 | 60.93 | 14.17 | 53.88 | 21.22 | |
| Blip-2 (FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, #Params=4.1B2026.04 | 74.96 | 71.27 | 3.69 | 68.8 | 6.17 | 62.01 | 11.88 | 49.89 | 25.07 | |
| LLaVA-1.6Image Encoder=OpenAI CLIP ViT-L/14, #Params=7B2026.04 | 72.1 | 71.7 | 0.39 | 71.17 | 0.93 | 61.6 | 10.51 | 56.33 | 15.77 | |
| OpenFlamingoImage Encoder=OpenAI CLIP ViT-L/14, #Params=3B2026.04 | 70.2 | 69.53 | 0.67 | 67.8 | 2.4 | 53.93 | 16.27 | 41.73 | 28.47 |