Image-to-Text Retrieval on Flickr30k zero-shot
96.9R@1BLIP-2
Evaluation Results
| Method | Links | |
|---|---|---|
| BLIP-2Backbone=ViT-L/16, Training data=400M, Storage per image=2,359 kB, Joint encoding parameters=167M, Inference time (ms)=98.642025.10 | 96.9 | |
| BLIPBackbone=ViT-L/16, Training data=129M, Storage per image=2,359 kB, Joint encoding parameters=139M, Inference time (ms)=101.612025.10 | 96.7 | |
| Local (EDJE)Backbone=ViT-L/16, Training data=12M, Storage per image=442kB, Joint encoding parameters=33M, Inference time (ms)=4.142025.10 | 96.5 | |
| Compressed-64 (EDJE)Backbone=ViT-L/16, Training data=12M, Storage per image=49kB, Joint encoding parameters=33M, Inference time (ms)=1.912025.10 | 96.4 | |
| Compressed-128 (EDJE)Backbone=ViT-L/16, Training data=12M, Storage per image=98kB, Joint encoding parameters=33M, Inference time (ms)=2.042025.10 | 96.3 | |
| BLIPBackbone=ViT-B/16, Training data=12M, Storage per image=1,769 kB, Joint encoding parameters=139M, Inference time (ms)=83.272025.10 | 94.8 | |
| Local (EDJE)Backbone=ViT-B/16, Training data=12M, Storage per image=442kB, Joint encoding parameters=33M, Inference time (ms)=2.862025.10 | 94.3 | |
| ALBEFBackbone=ViT-B/16, Training data=12M, Storage per image=1,769 kB, Joint encoding parameters=147M, Inference time (ms)=45.922025.10 | 94.1 |