Image Captioning on MSCOCO
79.7CLIPScoreLLaVA
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| LLaVAVariant=Lightning-MPT-7B2023.06 | 79.7 | 32.5 | 3.8 | — | — | 20 | 9.7 | 23.4 | |
| CapEnrich2023.06 | 79.2 | 13.3 | 150 | 9.4 | 22.6 | 63.1 | — | — | |
| Human2023.06 | 77.6 | 10.4 | 410 | 7.6 | 20 | 129.1 | — | — | |
| BLIP2023.06 | 77.2 | 10 | 140 | 6.7 | 16.6 | 95.8 | — | — | |
| BLIP-LMLE+SMILEBase Model=BLIP, Optimization=LMLE+SMILE2023.06 | 76.2 | 19.8 | 3.6 | — | — | 79.4 | 10.9 | 25.1 | |
| GdisCap2023.06 | 75.8 | 9.5 | 100 | 3.5 | 10.8 | 100.2 | — | — | |
| MiniGPT-4Parameters=7B2023.06 | 75.6 | 66.3 | 6.4 | — | — | 14.8 | 10.5 | 23.8 | |
| NliCap2023.06 | 75.5 | 9.5 | 80 | 2.9 | 9.3 | 67.8 | — | — | |
| BLIP-SMILEOptimization=SMILE2023.06 | 75 | 22.3 | 450 | 10 | 24.5 | 95.6 | — | — | |
| BLIP-SMILEBase Model=BLIP, Optimization=SMILE2023.06 | 75 | 22.3 | 4.5 | — | — | 95.6 | 10 | 24.5 | |
| OursBackbone=google/siglip2-base-patch16-2562026.04 | 40.6 | — | — | — | — | — | — | — | |
| HumanBackbone=google/siglip2-base-patch16-2562026.04 | 38.1 | — | — | — | — | — | — | — | |
| GLSBackbone=google/siglip2-base-patch16-2562026.04 | 35.6 | — | — | — | — | — | — | — | |
| BLIP-2Backbone=google/siglip2-base-patch16-2562026.04 | 35.4 | — | — | — | — | — | — | — |