Text-to-Image Retrieval on COCO
70.2Recall@1EVA-CLIP-8B
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| EVA-CLIP-8B#Params=4.59B, Zero-shot=true, Strategy=Distillation2026.03 | 70.2 | 88.8 | 93.4 | — | 86.1 | — | — | |
| EVA-CLIP-8B#Params=7.53B, Zero-shot=true, Strategy=Original2026.03 | 69.6 | 88.6 | 93.2 | — | 85.7 | — | — | |
| EVA-CLIP-E#Params=4.35B, Zero-shot=true, Strategy=Original2026.03 | 68.8 | 87.8 | 93 | — | 85.2 | — | — | |
| EVA-CLIP-E#Params=2.50B, Zero-shot=true, Strategy=Distillation2026.03 | 68.6 | 87.9 | 93.2 | — | 85.3 | — | — | |
| SOTA2024.06 | 68.3 | — | — | — | — | — | — | |
| BLIP2FLOPs=717.5, Throughput=10.82026.01 | 68.3 | 87.7 | — | — | — | — | — | |
| MiCo2024.06 | 68.1 | — | — | — | — | — | — | |
| VisionTrimFLOPs=265.2, Throughput=27.5, Delta FLOPs=63.0%, Delta Throughput=154.6%2026.01 | 68 | 87.5 | — | — | — | — | — | |
| TurboFLOPs=396.5, Throughput=18.6, Delta FLOPs=44.9%, Delta Throughput=72.2%2026.01 | 67.1 | 87.1 | — | — | — | — | — | |
| OpenCLIP-G#Params=1.17B, Zero-shot=true, Strategy=Distillation2026.03 | 67.1 | 87 | 92.7 | — | 85 | — | — | |
| OpenCLIP-G#Params=1.84B, Zero-shot=true, Strategy=Original2026.03 | 66.9 | 87.2 | 92.8 | — | 85 | — | — | |
| OpenCLIP-g#Params=1.01B, Zero-shot=true, Strategy=Original2026.03 | 66.4 | 86 | 91.8 | — | 83.8 | — | — | |
| OpenCLIP-g#Params=0.62B, Zero-shot=true, Strategy=Distillation2026.03 | 66.2 | 86.5 | 91.9 | — | 84 | — | — | |
| BLIP#Example=135M2023.04 | 65.1 | 86.3 | 91.8 | — | — | — | — | |
| Florence#Example=900M2023.04 | 63.2 | 85.7 | — | — | — | — | — | |
| VALORL#Example=33.5M, Resolution=3922023.04 | 61.4 | 84.4 | 90.9 | — | — | — | — | |
| FILIP#Example=340M2023.04 | 61.2 | 84.3 | 90.6 | — | — | — | — | |
| ALBEF#Example=20M2023.04 | 60.7 | 84.3 | 90.5 | — | — | — | — | |
| OpenCLIP-G#Params=1.17B, Zero-shot=true, Strategy=Pruning2026.03 | 60.7 | 83 | 89.9 | — | 80.8 | — | — | |
| MADTPGFLOPs=87.42024.03 | 60.3 | 83.6 | 89.9 | — | — | — | — | |
| ALIGN#Example=1.8B2023.04 | 59.9 | 83.3 | 89.8 | — | — | — | — | |
| UPopGFLOPs=88.32024.03 | 59.8 | 83.1 | 89.8 | — | — | — | — | |
| UFO#Example=10M2023.04 | 59.2 | 83.6 | 90.5 | — | — | — | — | |
| VinVL#Example=10M2023.04 | 58.8 | 83.5 | 90.3 | — | — | — | — | |
| METER#Example=10M2023.04 | 57.9 | 82.7 | 90.1 | — | — | — | — | |
| Oscar#Example=10M2023.04 | 57.5 | 82.8 | 89.8 | — | — | — | — | |
| FG-CLIP2Backbone=ViT-So/162026.02 | 56.7 | — | — | — | — | — | — | |
| OpenCLIP-g#Params=0.62B, Zero-shot=true, Strategy=Pruning2026.03 | 56.6 | 79.3 | 86.3 | — | 77.9 | — | — | |
| ELIPGFLOPs=93.42024.03 | 56.3 | 81.2 | 88.7 | — | — | — | — | |
| SigLIP 2Setting=Zero-shot2026.02 | 55.8 | — | — | — | — | — | — | |
| SigLIP2Backbone=ViT-So/162026.02 | 55.8 | — | — | — | — | — | — | |
| GMEParameters=7B2026.02 | 55.6 | — | — | — | — | — | — | |
| ToMeGFLOPs=69.82024.03 | 55.3 | 81.2 | 88.7 | — | — | — | — | |
| Qwen3-VL-EmbeddingParameters=2B2026.02 | 55.2 | — | — | — | — | — | — | |
| VersaViTVision backbone state=Unfrozen, Projection layer fine-tuning=true, Training data alignment=30M image-text pairs2026.02 | 54.8 | — | — | — | — | — | — | |
| SigLIP2ViT=L/16, Data=10B2026.01 | 54.7 | — | — | — | — | — | — | |
| UME-R1Parameters=2B2026.02 | 54.4 | — | — | — | — | — | — | |
| EVA-CLIP-8BSetting=Zero-shot2026.02 | 53 | — | — | — | — | — | — | |
| UNITER#Example=10M2023.04 | 52.9 | 79.9 | 88 | — | — | — | — | |
| ObjEmbedParameters=4B2026.02 | 52.2 | — | — | — | — | — | — | |
| SigLIP2ViT=B/16, Data=10B2026.01 | 52.1 | — | — | — | — | — | — | |
| SigLIPSetting=Zero-shot2026.02 | 52 | — | — | — | — | — | — | |
| GMEParameters=2B2026.02 | 51.7 | — | — | — | — | — | — | |
| SigLIPViT=L/16, Data=10B2026.01 | 51.2 | — | — | — | — | — | — | |
| ObjEmbedParameters=2B2026.02 | 51 | — | — | — | — | — | — | |
| EViTGFLOPs=48.02024.03 | 50.8 | 77.9 | 86.3 | — | — | — | — | |
| MobileCLIP-BTraining Dataset=DataCompDR-1B, Image Encoder=ViT-B/162023.11 | 50.6 | — | — | — | — | — | — | |
| VLM2Vec-V2Parameters=2B2026.02 | 50.3 | — | — | — | — | — | — | |
| MobileCLIP-B (LT)Training Dataset=DataCompDR-1B, Image Encoder=ViT-B/162023.11 | 50 | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-L/142026.02 | 48.5 | — | — | — | — | — | — | |
| VeCLIP-B/16Training Dataset=WIT-200M, Image Encoder=ViT-B/162023.11 | 48.4 | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=02023.06 | 48.1 | — | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-L/142026.02 | 48.1 | — | — | — | — | — | — | |
| EVA-CLIPBackbone=ViT-L/142026.02 | 47.9 | — | — | — | — | — | — | |
| SigLIP-B/16Training Dataset=Webli-1B, Image Encoder=ViT-B/162023.11 | 47.8 | — | — | — | — | — | — | |
| MetaCLIP2Backbone=ViT-H/142026.02 | 47.7 | — | — | — | — | — | — | |
| SigLIPViT=B/16, Data=10B2026.01 | 47.2 | — | — | — | — | — | — | |
| LongD-CLIPBackbone=ViT-L/142026.02 | 47 | — | — | — | — | — | — | |
| VersaViTVision backbone state=Frozen, Projection layer fine-tuning=true, Training data alignment=30M image-text pairs2026.02 | 46.9 | — | — | — | — | — | — | |
| Ensemble TeacherTraining Dataset=DataComp-1B [18], OpenAI-400M [47], Image Encoder=ViT-L/142023.11 | 46.7 | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=12B2023.06 | 46.3 | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=12B, Zero-shot=true, Frozen transfer=true2023.06 | 46.3 | — | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/142026.02 | 46.3 | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L/142026.02 | 46.2 | — | — | — | — | — | — | |
| TULIPBackbone=ViT-L/142026.02 | 46.1 | — | — | — | — | — | — | |
| DINOv3Setting=Zero-shot2026.02 | 45.6 | — | — | — | — | — | — | |
| Long-CLIP + GMAILZero-shot=true, Pre-trained=true2026.02 | 45.6 | 69.8 | 79.5 | — | — | — | — | |
| MobileCLIP-S2Training Dataset=DataCompDR-1B, Image Encoder=MCi22023.11 | 45.4 | — | — | — | — | — | — | |
| CapPa L/14LiT pairs=12B2023.06 | 45.4 | — | — | — | — | — | — | |
| CapPa L/14LiT pairs=12B, Zero-shot=true, Frozen transfer=true2023.06 | 45.4 | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=3B2023.06 | 44.7 | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=3B, Zero-shot=true, Frozen transfer=true2023.06 | 44.7 | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Fine-tuning dataset=DCI, Zero-shot transfer=true2025.12 | 44.25 | 69.2 | — | — | — | — | — | |
| GOALBackbone=ViT-L/14, Fine-tuning dataset=DOCCI, Zero-shot transfer=true2025.12 | 44.22 | 69.19 | — | — | — | — | — | |
| MobileCLIP-S1Training Dataset=DataCompDR-1B, Image Encoder=MCi12023.11 | 44 | — | — | — | — | — | — | |
| GOALBackbone=ViT-L/14, Fine-tuning dataset=DCI, Zero-shot transfer=true2025.12 | 43.9 | 68.6 | — | — | — | — | — | |
| CapPa L/14LiT pairs=3B2023.06 | 43.9 | — | — | — | — | — | — | |
| CapPa L/14LiT pairs=3B, Zero-shot=true, Frozen transfer=true2023.06 | 43.9 | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Fine-tuning dataset=DOCCI, Zero-shot transfer=true2025.12 | 43.69 | 69.73 | — | — | — | — | — | |
| DFN-B/16Training Dataset=DFN-2B [16], Image Encoder=ViT-B/162023.11 | 43.4 | — | — | — | — | — | — | |
| MTVViT=L/16, Data=100M2026.01 | 43 | — | — | — | — | — | — | |
| CLIP* (16k)LiT pairs=02023.06 | 43 | — | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-B/162026.02 | 43 | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=900M2023.06 | 42.7 | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-B/162026.02 | 42.4 | — | — | — | — | — | — | |
| LAION-B/16Training Dataset=LAION-2B [52], Image Encoder=ViT-B/162023.11 | 42.3 | — | — | — | — | — | — | |
| DataComp-B/16Training Dataset=DataComp-1B [18], Image Encoder=ViT-B/162023.11 | 42.3 | — | — | — | — | — | — | |
| EVA02-B/16Training Dataset=Merged-2B [55], Image Encoder=ViT-B/162023.11 | 42.2 | — | — | — | — | — | — | |
| EVA-CLIP-E#Params=2.50B, Zero-shot=true, Strategy=Pruning2026.03 | 41.7 | 66.2 | 76.6 | — | 70 | — | — | |
| CLIP* (8k)LiT pairs=02023.06 | 41.5 | — | — | — | — | — | — | |
| HyFL-CLIPBackbone=ViT-B/16, Evaluation Protocol=zero-shot2026.07 | 41.5 | — | — | — | — | — | — | |
| MTVViT=B/16, Data=100M2026.01 | 41.2 | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L/14, Fine-tuning dataset=DOCCI, Zero-shot transfer=true2025.12 | 41.18 | 65.96 | — | — | — | — | — | |
| LongD-CLIPBackbone=ViT-B/162026.02 | 41.1 | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L/14, Fine-tuning dataset=DCI, Zero-shot transfer=true2025.12 | 40.95 | 65.7 | — | — | — | — | — | |
| HiMo-CLIPBackbone=ViT-B/16, Evaluation Protocol=zero-shot, Implementation Source=our implementation2026.07 | 40.71 | — | — | — | — | — | — | |
| TULIPBackbone=ViT-B/162026.02 | 40.7 | — | — | — | — | — | — | |
| TULIPBackbone=ViT-B/16, Evaluation Protocol=zero-shot2026.07 | 40.7 | — | — | — | — | — | — | |
| CapPa L/14LiT pairs=900M2023.06 | 40.6 | — | — | — | — | — | — | |
| EVA-CLIP-8B#Params=4.59B, Zero-shot=true, Strategy=Pruning2026.03 | 40.5 | 63.3 | 73.4 | — | 72.2 | — | — |