Image Captioning on Crossmodal-3600 (test)
98.1Score (en)PaLI-17B
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| PaLI-17BNumber of Parameters=17B, Fine-tuning Dataset=COCO-35L, Resolution=224x2242022.09 | 98.1 | 75.5 | 31.3 | 46.8 | 35.8 | 72.1 | 36.5 | 53.6 | — | — | |
| PaLIFine-tuning=true, Resolution=224x2242023.05 | 98.1 | 75.5 | 31.3 | 46.8 | 35.8 | 72.1 | 36.5 | 53.6 | — | — | |
| PaLI-XFine-tuning=true, Resolution=224x2242023.05 | 94.2 | 78.7 | 32 | 46.9 | 36.9 | 75.3 | 36.1 | 53.1 | — | — | |
| PaLI-3BNumber of Parameters=3B, Fine-tuning Dataset=COCO-35L, Resolution=224x2242022.09 | 92.8 | 68.6 | 30.3 | 39.2 | 30.3 | 65.9 | 32.2 | 47 | — | — | |
| BB+CCLearning Setup=Multilingual Captioning Supervised Learning2023.05 | 58.4 | — | 19.7 | — | — | — | 20.2 | — | — | 42.5 | |
| Thapliyal et al. (2022)Number of Parameters=0.8B2022.09 | 57.6 | 40.9 | 20.6 | 16.1 | 13.9 | 35.5 | 19.8 | 28.9 | — | — | |
| LMCAP+Learning Setup=Few-shot Learning, Increased Datastore=true2023.05 | 52.6 | — | 7.8 | — | — | — | 25.1 | — | — | 32.6 | |
| LMCAPLearning Setup=Few-shot Learning2023.05 | 45.2 | — | 13.2 | — | — | — | 22.1 | — | — | 32.9 | |
| LgLearning Setup=Multilingual Captioning Supervised Learning2023.05 | 34.3 | — | 11.1 | — | — | — | 9.9 | — | — | 22 | |
| BgLearning Setup=Multilingual Captioning Supervised Learning2023.05 | 33.7 | — | 11.2 | — | — | — | 11 | — | — | 23.2 | |
| BBLearning Setup=Multilingual Captioning Supervised Learning2023.05 | 29.7 | — | 9.8 | — | — | — | 8.7 | — | — | 19.4 | |
| PaLIEvaluation Protocol=fine-tune2023.05 | — | — | — | — | — | — | — | — | 53.6 | — | |
| PaLI-XShots=4 shots2023.05 | — | — | — | — | — | — | — | — | 45.1 | — | |
| PaLI-XShots=32 shots2023.05 | — | — | — | — | — | — | — | — | 47.1 | — |