Image-to-Text Retrieval on FLICKR30K (R@1, R@5, R@10)
97.3R@1BLIP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BLIP# Tunable=223M, Fine-tuning strategy=full fine-tuning2025.12 | 97.3 | 99.9 | 100 | |
| DoRA (r=32)# Tunable=10.8M, Fine-tuning strategy=frozen backbone, rank=322025.12 | 96.7 | 99.8 | 100 | |
| UniAdapter (r=512)# Tunable=19.5M, Fine-tuning strategy=frozen backbone, rank=5122025.12 | 96.7 | 99.7 | 100 | |
| Aurora (r=64)# Tunable=0.6M, Fine-tuning strategy=frozen backbone, rank=642025.12 | 96.7 | 99.8 | 100 | |
| Null-LoRA# Tunable=6.0M, Fine-tuning strategy=frozen backbone2025.12 | 96.6 | 100 | 100 | |
| LoRA (r=32)# Tunable=10.6M, Fine-tuning strategy=frozen backbone, rank=322025.12 | 96.3 | 99.7 | 99.8 | |
| ALBEF# Tunable=210M, Fine-tuning strategy=full fine-tuning2025.12 | 95.9 | 99.8 | 100 | |
| ALIGN# Tunable=820M, Fine-tuning strategy=full fine-tuning2025.12 | 95.3 | 99.8 | 100 | |
| VILLA# Tunable=330M, Fine-tuning strategy=full fine-tuning2025.12 | 87.9 | 97.5 | 98.8 | |
| UNITER# Tunable=330M, Fine-tuning strategy=full fine-tuning2025.12 | 87.3 | 98 | 99.2 | |
| UniConBackbone=CLIP ViT-B/32, Train time=0.76 s2026.04 | 28.4 | — | 63.6 | |
| SGD–CLIPBackbone=CLIP ViT-B/32, Train time=45.3 s2026.04 | 23.1 | — | 59.5 | |
| UniConBackbone=RN-50 + SBERT, Train time=0.81 s2026.04 | 13.4 | — | 46.4 | |
| SGD–CLIPBackbone=RN-18 + SBERT, Train time=45.6 s2026.04 | 4.3 | — | 22.1 | |
| SGD–CLIPBackbone=RN-50 + SBERT, Train time=45.0 s2026.04 | 4.3 | — | 22.1 | |
| UniConBackbone=RN-18 + SBERT, Train time=1.7 s2026.04 | 2 | — | 14.5 |