Text-to-Image Retrieval on COCO 5K (test)
64.3R@1Uncompressed
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| UncompressedModel=BLIP, Pruning Mode=/, Pruning Ratio=/, GFLOPs=91.652026.04 | 64.3 | 85.7 | — | |
| UncompressedModel=BLIP, Pruning Mode=None, Pruning Ratio=None, GFLOPs=91.652026.04 | 64.3 | 85.7 | — | |
| CoMPModel=BLIP, Pruning Mode=C, Pruning Ratio=0.7, GFLOPs=30.082026.04 | 57 | 81.1 | — | |
| CoMPModel=BLIP, Pruning Mode=C, Pruning Ratio=0.7, GFLOPs=30.082026.04 | 57 | 81.1 | — | |
| UncompressedBackbone=CLIP, Reduce Ratio=/, GFLOPS=395.72024.03 | 56.8 | 80.7 | 87.6 | |
| UncompressedModel=CLIP, Pruning Mode=/, Pruning Ratio=/, GFLOPs=197.82026.04 | 56.8 | 80.7 | — | |
| UncompressedModel=CLIP, Pruning Mode=None, Pruning Ratio=None, GFLOPs=197.82026.04 | 56.8 | 80.7 | — | |
| MADTPModel=BLIP, Pruning Mode=T, Pruning Ratio=0.7, GFLOPs=30.692026.04 | 56 | 80.6 | — | |
| MADTPModel=BLIP, Pruning Mode=T, Pruning Ratio=0.7, GFLOPs=30.692026.04 | 56 | 80.6 | — | |
| UPopModel=BLIP, Pruning Mode=P, Pruning Ratio=0.7, GFLOPs=34.332026.04 | 55.5 | 81.1 | — | |
| UPopModel=BLIP, Pruning Mode=P, Pruning Ratio=0.7, GFLOPs=34.332026.04 | 55.5 | 81.1 | — | |
| SLQ (InternVL3-8B)Model category=Ours, Backbone=InternVL3, Scale=8B2026.04 | 55.4 | 79.7 | 86.8 | |
| MADTPBackbone=CLIP, Reduce Ratio=0.5, GFLOPS=190.22024.03 | 55 | 79.9 | 87.5 | |
| VACSRBackbone=CLIP ViT-B/162026.05 | 54.5 | 81.1 | 88.7 | |
| PCME++Backbone=CLIP ViT-B/162026.05 | 53.4 | 80.3 | 88.3 | |
| UPopBackbone=CLIP, Reduce Ratio=0.5, GFLOPS=196.32024.03 | 53.1 | 79.9 | 87.3 | |
| E5-V-7BModel category=MLLM-based, Scale=7B2026.04 | 52 | 76.5 | 84.7 | |
| CoMPModel=CLIP, Pruning Mode=C, Pruning Ratio=0.75, GFLOPs=45.12026.04 | 51.7 | 77.6 | — | |
| CoMPModel=CLIP, Pruning Mode=C, Pruning Ratio=0.75, GFLOPs=45.12026.04 | 51.7 | 77.6 | — | |
| PCMEBackbone=CLIP ViT-B/162026.05 | 51.2 | 79.1 | 87.5 | |
| SLQ (Qwen3VL-4B)Model category=Ours, Backbone=Qwen3VL, Scale=4B2026.04 | 50.4 | 75.2 | 83.4 | |
| SLQ (Qwen3VL-2B)Model category=Ours, Backbone=Qwen3VL, Scale=2B2026.04 | 50.2 | 75.7 | 83.9 | |
| MADTPBackbone=CLIP, Reduce Ratio=0.75, GFLOPS=92.42024.03 | 49.9 | 76.3 | 85.1 | |
| MADTPModel=CLIP, Pruning Mode=T, Pruning Ratio=0.75, GFLOPs=46.22026.04 | 49.9 | 76.3 | — | |
| MADTPModel=CLIP, Pruning Mode=T, Pruning Ratio=0.75, GFLOPs=46.22026.04 | 49.9 | 76.3 | — | |
| VACSRBackbone=CLIP ViT-B/322026.05 | 49.8 | 77.7 | 86.3 | |
| VLM2VEC-7BModel category=MLLM-based, Scale=7B2026.04 | 49.2 | 73.8 | 83.3 | |
| 3TTraining Data Size=5B, Regime=internet-scale2023.12 | 48.5 | — | — | |
| SLQ (InternVL3-1B)Model category=Ours, Backbone=InternVL3, Scale=1B2026.04 | 48.5 | 74.3 | 83.1 | |
| BLIP ViT-LModel category=Dual-Encoder, Backbone=ViT-L2026.04 | 48.4 | 74.4 | 83.2 | |
| PCME++Backbone=CLIP ViT-B/322026.05 | 48.1 | 76.5 | 85.4 | |
| P2RMBackbone=CLIP ViT-B/162026.05 | 48.1 | 76.6 | 85.7 | |
| FuseMixTraining Data Size=5M, Regime=low-data regime, Variant=(D,B)2023.12 | 46.3 | 74.6 | 83.4 | |
| P2RMBackbone=CLIP ViT-B/322026.05 | 46.3 | 74.9 | 84.4 | |
| FuseMixTraining Data Size=5M, Regime=low-data regime, Variant=(D,E)2023.12 | 46.1 | 74.3 | 84.1 | |
| TIGeRModel category=MLLM-based2026.04 | 46.1 | 69 | 76.1 | |
| DAABackbone=CLIP ViT-B/322026.05 | 46.1 | 74.7 | 84.2 | |
| PCMEBackbone=CLIP ViT-B/322026.05 | 46.1 | 75 | 84.6 | |
| FILIPTraining Data Size=300M, Regime=internet-scale2023.12 | 45.9 | 70.6 | 79.3 | |
| ALIGNTraining Data Size=1B, Regime=internet-scale2023.12 | 45.6 | 69.8 | 78.6 | |
| FLAMEModel category=Dual-Encoder2026.04 | 43.9 | 70.4 | 79.7 | |
| LITTraining Data Size=4B, Regime=internet-scale2023.12 | 43.6 | — | — | |
| FuseMixTraining Data Size=5M, Regime=low-data regime, Variant=(U,E)2023.12 | 42.9 | 70 | 80.1 | |
| FuseMixTraining Data Size=5M, Regime=low-data regime, Variant=(U,B)2023.12 | 42.5 | 70.2 | 80 | |
| UPopBackbone=CLIP, Reduce Ratio=0.75, GFLOPS=105.92024.03 | 41.1 | 71 | 81.4 | |
| UPopModel=CLIP, Pruning Mode=P, Pruning Ratio=0.75, GFLOPs=57.92026.04 | 41.1 | 71 | — | |
| UPopModel=CLIP, Pruning Mode=P, Pruning Ratio=0.75, GFLOPs=57.92026.04 | 41.1 | 71 | — | |
| CLIPTraining Data Size=400M, Regime=internet-scale2023.12 | 37.8 | 62.4 | 72.2 | |
| CLIP ViT-LModel category=Dual-Encoder, Backbone=ViT-L2026.04 | 37 | 61.6 | 71.5 | |
| FuseMixTraining Data Size=3M, Regime=low-data regime, Variant=(D,B)2023.12 | 32.2 | 58.2 | 69.4 | |
| CLIP ViT-BModel category=Dual-Encoder, Backbone=ViT-B2026.04 | 30.5 | 56 | 66.8 | |
| CLIPTraining Data Size=3M, Regime=low-data regime2023.12 | 29.9 | 57.9 | 66.9 | |
| DAABackbone=CLIP ViT-B/162026.05 | 22.4 | 47.1 | 59.1 |