Image Captioning on MS COCO v1.3 (val)
8.1CHAIRiLLaVA-v1.3 7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LLaVA-v1.3 7BBackbone=LLaVA-v1.3-7B, Decoding Strategy=Multinomial2024.03 | 8.1 | 17.5 | 53.3 | |
| LLaVA-v1.3 13BBackbone=LLaVA-v1.3-13B, Decoding Strategy=Multinomial2024.03 | 7.4 | 18.5 | 55.2 | |
| LLaVA-v1.3 7B PMIBackbone=LLaVA-v1.3-7B, Decoding Strategy=PMI2024.03 | 6.7 | 16.2 | 51.5 | |
| LLaVA-v1.3 13B PMIBackbone=LLaVA-v1.3-13B, Decoding Strategy=PMI2024.03 | 6.5 | 16.6 | 54.7 | |
| LLaVA-v1.3 13B ContrastiveBackbone=LLaVA-v1.3-13B, Decoding Strategy=Contrastive Decoding2024.03 | 6.5 | 14.5 | 54.7 | |
| LLaVA-v1.3 13B + LUREBackbone=LLaVA-v1.3-13B, Training Method=LURE2024.03 | 6.4 | 27.1 | — | |
| LLaVA-v1.3 7B ContrastiveBackbone=LLaVA-v1.3-7B, Decoding Strategy=Contrastive Decoding2024.03 | 6.3 | 14.8 | 55.2 | |
| LLaVA-v1.3 7B M3IDBackbone=LLaVA-v1.3-7B, Decoding Strategy=M3ID2024.03 | 5.9 | 13.8 | 55.1 | |
| LLaVA-v1.3 7B M3ID + DPOBackbone=LLaVA-v1.3-7B, Decoding Strategy=M3ID, Training Method=DPO2024.03 | 5.7 | 13.5 | 55.8 | |
| LLaVA-v1.3 13B M3IDBackbone=LLaVA-v1.3-13B, Decoding Strategy=M3ID2024.03 | 5.5 | 13.2 | 54 | |
| mPLUG-Owl + LUREBackbone=mPLUG-Owl, Training Method=LURE2024.03 | 5.4 | 18.8 | — | |
| LLaVA-v1.3 13B M3ID + DPOBackbone=LLaVA-v1.3-13B, Decoding Strategy=M3ID, Training Method=DPO2024.03 | 5.3 | 12.6 | 54.2 |