Image Captioning on Flickr30k (test) using VQA/Downstream Metrics
58.3TextVQAZeroshot
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| ZeroshotBackbone=LLaVA-1.5-7B2026.02 | 58.3 | 58 | 65.1 | 64.6 | 58.2 | 62 | 25.3 | 43.1 | 35.7 | |
| Model GraftingBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 56.9 | 55.9 | 64.1 | 64.9 | 58.2 | 60.4 | 64 | 62 | 62 | |
| SPIDERBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 56.6 | 54.2 | 64.3 | 63.9 | 55.2 | 59.4 | 71 | 65 | 64.4 | |
| Model-DowserBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 56.5 | 55.2 | 63.3 | 63.8 | 55.1 | 59.6 | 85 | 72 | 69.6 | |
| ModelTailorBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 56.1 | 52.1 | 63.4 | 65 | 56.4 | 59.1 | 78 | 68.3 | 67 | |
| DAREBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 55.3 | 51.4 | 62.8 | 64.5 | 54.6 | 58.3 | 66.3 | 62.1 | 61.8 | |
| Full-FTBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 50.6 | 51.5 | 62.3 | 64.3 | 54.5 | 57.6 | 67.3 | 62.1 | 61.6 |