Image-to-text retrieval on DOCCI (test)
95.9Recall@1Grounded Recaptioning
Evaluation Results
| Method | Links | |
|---|---|---|
| Grounded Recaptioning2024.12 | 95.9 | |
| OursZero-shot=true2024.12 | 94.5 | |
| CS-Aligner-3MBackbone=CLIP ViT-L/14, Text Encoder=Llama 3 (8B), Training Data=CC3M2025.02 | 89.1 | |
| LLM2CLIP-3MBackbone=CLIP ViT-L/14, Text Encoder=Llama 3 (8B), Training Data=CC3M2025.02 | 87.8 | |
| CS-Aligner-3MBackbone=CLIP ViT-L/14, Text Encoder=Llama 3 (8B), Training Data=CC3M2025.02 | 86.6 | |
| LLM2CLIP-3MBackbone=CLIP ViT-L/14, Text Encoder=Llama 3 (8B), Training Data=CC3M2025.02 | 84.9 | |
| Long-CLIP2025.02 | 78.6 | |
| MATEZero-shot=true2024.12 | 73.4 | |
| Long-CLIP2025.02 | 66.5 | |
| CLIP2025.02 | 65.8 | |
| CLIP2025.02 | 63.1 | |
| MATE2024.12 | 62.9 | |
| C2LIPMethod Category=Models fine-tuned by us2026.03 | 60 | |
| SigLIPBackbone=ViT-B/16, Fine-tuning Dataset=CC3M, Method Category=Models fine-tuned by us2026.03 | 59.8 | |
| CoCaZero-shot=true2024.12 | 59.1 | |
| SigLIPBackbone=ViT-B/162026.03 | 58.9 | |
| TIPSZero-shot=true2024.12 | 58.8 | |
| DreamLIP-3mMethod Category=Fine-grained models2026.03 | 58.8 | |
| CLIPZero-shot=true2024.12 | 58.4 | |
| TIPS2024.12 | 57.2 | |
| CoCa2024.12 | 56.7 | |
| FG-CLIPMethod Category=Fine-grained models2026.03 | 56.7 | |
| CLIP2024.12 | 55.6 | |
| BLIP2024.12 | 54.7 | |
| BLIPZero-shot=true2024.12 | 54.1 | |
| CLICMethod Category=Composition-aware models2026.03 | 51.3 | |
| CLIP (OpenAI)Backbone=ViT-B/162026.03 | 50.4 | |
| FLAIR-3mMethod Category=Fine-grained models2026.03 | 47.2 | |
| CLIP (OpenAI)Backbone=ViT-B/322026.03 | 47.1 | |
| LLIPMethod Category=Fine-grained models2026.03 | 46.9 | |
| CoN-CLIPMethod Category=Composition-aware models2026.03 | 46 | |
| Long-CLIPZero-shot=true2024.12 | 45.2 | |
| NegCLIPMethod Category=Composition-aware models2026.03 | 45.2 | |
| FineCLIPMethod Category=Fine-grained models2026.03 | 44.9 | |
| SLVC-RMethod Category=Composition-aware models2026.03 | 42.1 | |
| SLVC-RLMethod Category=Composition-aware models2026.03 | 41.8 | |
| TripletCLIPMethod Category=Composition-aware models2026.03 | 39.8 | |
| Long-CLIP2024.12 | 38.6 | |
| DAC-SAMMethod Category=Composition-aware models2026.03 | 31.2 | |
| CE-CLIPMethod Category=Composition-aware models2026.03 | 30.8 | |
| DAC-LLMMethod Category=Composition-aware models2026.03 | 27.1 | |
| Codebook-CLIPMethod Category=Codebook-based models2026.03 | 0.1 | |
| IL-CLIPMethod Category=Codebook-based models2026.03 | 0.1 |