Image Captioning on COCO Captioning (val)
35.4BLEU-4Uni-Perceiver-V2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Uni-Perceiver-V2Backbone=ViT-B, Open-Ended=false2023.05 | 35.4 | 116.9 | |
| Pix2Seq v2Backbone=ViT-B, Open-Ended=false2023.05 | 34.9 | — | |
| Uni-Perceiver-MoEBackbone=ViT-B, Open-Ended=false2023.05 | 33.2 | — | |
| VisionLLM-HBackbone=Intern-H, Open-Ended=true, Training Mode=shared-parameter2023.05 | 32.1 | 114.2 | |
| Uni-PerceiverBackbone=ViT-B, Open-Ended=false2023.05 | 32 | — | |
| VisionLLM-R50Backbone=ResNet-50, Open-Ended=true, Training Mode=shared-parameter2023.05 | 31 | 112.5 | |
| VisionLLM-R50Backbone=ResNet-50, Open-Ended=false, Training Mode=separately trained2023.05 | 30.8 | 112.4 | |
| UniTabBackbone=ResNet-101, Open-Ended=false2023.05 | — | 115.8 | |
| VL-T5Backbone=T5-B, Open-Ended=false2023.05 | — | 116.5 |