Image-to-Text Retrieval on Flickr30K-CN
96.6R@1CN-CLIP
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CN-CLIPSetup=Finetuning, Model Size=Large, Backbone=ViT-L/14, Resolution=336px2022.11 | 96.6 | 99.8 | 100 | — | |
| CN-CLIPSetup=Finetuning, Model Size=Large, Backbone=ViT-L/142022.11 | 96.1 | 99.5 | 99.9 | — | |
| R2D2Setup=Finetuning, Model Size=Large, Backbone=ViT-L/142022.11 | 95.6 | 99.8 | 100 | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Finetuning2026.02 | 95.5 | 99.8 | 100 | — | |
| CN-CLIPSetup=Finetuning, Model Size=Huge, Backbone=ViT-H/142022.11 | 95.3 | 99.7 | 100 | — | |
| BaselineBackbone=CN-CLIP (ViT-H/14), CR=0, Setting=Finetuning2026.02 | 95.3 | 99.7 | 100 | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 95.3 | 99.4 | 100 | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Finetuning2026.02 | 95 | 99.3 | 100 | — | |
| ObjEmbedParameters=4B2026.02 | 94.7 | — | — | — | |
| ObjEmbedParameters=2B2026.02 | 94 | — | — | — | |
| M2-EncoderModel Size=10B, Protocol=Zero-shot2024.01 | 93.8 | 99.7 | 99.9 | 94.9 | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 93.8 | 99.2 | 100 | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Finetuning2026.02 | 93.6 | 99.1 | 99.9 | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 93.6 | 98.9 | 99.9 | — | |
| CN-CLIPSetup=Finetuning, Model Size=Base, Backbone=ViT-B/162022.11 | 93.5 | 99 | 99.5 | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 93.1 | 99 | 99.6 | — | |
| Wukong_ViT-LBackbone=ViT-L, Evaluation Protocol=Fine-tuned2022.02 | 92.7 | 99.1 | 99.6 | 93.4 | |
| WukongSetup=Finetuning, Model Size=Large, Backbone=ViT-L/142022.11 | 92.7 | 99.1 | 99.6 | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 92.7 | 98.9 | 99.7 | — | |
| R2D2Setup=Finetuning, Model Size=Base, Backbone=ViT-B2022.11 | 92.6 | 99.1 | 99.8 | — | |
| Qwen3-VL-EmbeddingParameters=2B2026.02 | 91.9 | — | — | — | |
| GMEParameters=7B2026.02 | 91.8 | — | — | — | |
| CLIP_ViT-LBackbone=ViT-L, Evaluation Protocol=Fine-tuned2022.02 | 91.6 | 99.1 | 99.7 | 93.2 | |
| M2-EncoderModel Size=1B, Protocol=Zero-shot2024.01 | 91.5 | 99.3 | 99.7 | 93.6 | |
| FG-CLIP2Backbone=ViT-So/162026.02 | 91.5 | — | — | — | |
| FILIP_ViT-LBackbone=ViT-L, Evaluation Protocol=Fine-tuned2022.02 | 90.6 | 98.8 | 99.6 | 93 | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 90.2 | 98.8 | 99.5 | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Finetuning2026.02 | 89.9 | 98.7 | 99.6 | — | |
| MetaCLIP2Backbone=ViT-H/142026.02 | 89.3 | — | — | — | |
| M2-EncoderModel Size=0.4B, Protocol=Zero-shot2024.01 | 87.9 | 98.4 | 99.4 | 91.2 | |
| UME-R1Parameters=2B2026.02 | 87.9 | — | — | — | |
| PTQ-P4Q (8bit)Backbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 87.8 | 98.1 | 99.2 | — | |
| PTQ-MinMax (8bit)Backbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 87.3 | 97.9 | 99.2 | — | |
| CLIP_ViT-BBackbone=ViT-B, Evaluation Protocol=Fine-tuned2022.02 | 87.1 | 97.7 | 98.8 | 89.7 | |
| Wukong_Swin-LBackbone=Swin-L, Evaluation Protocol=Fine-tuned2022.02 | 86.2 | 98.1 | 99.4 | 89.3 | |
| FILIP_Swin-LBackbone=Swin-L, Evaluation Protocol=Fine-tuned2022.02 | 86 | 97.5 | 99.1 | 90 | |
| CLIP_Swin-LBackbone=Swin-L, Evaluation Protocol=Fine-tuned2022.02 | 85.8 | 97.1 | 99 | 89.1 | |
| GMEParameters=2B2026.02 | 85.5 | — | — | — | |
| AltCLIPBackbone=ViT-L, Zero-shot=true, Stage=Contrastive Learning2022.11 | 84.8 | 97.4 | 98.8 | 89.2 | |
| AltCLIPModel Size=0.8B, Protocol=Zero-shot2024.01 | 84.8 | 97.4 | 98.8 | 89.2 | |
| AltCLIPTBackbone=ViT-L, Zero-shot=true, Stage=Teacher Learning2022.11 | 84.7 | 97.4 | 98.7 | 87.2 | |
| CN-CLIPSetup=Finetuning, Model Size=Tiny, Backbone=ResNet-502022.11 | 84.2 | 96.7 | 98 | — | |
| VLM2Vec-V2Parameters=2B2026.02 | 84 | — | — | — | |
| Wukong_ViT-BBackbone=ViT-B, Evaluation Protocol=Fine-tuned2022.02 | 83.9 | 97.6 | 99 | 88.7 | |
| WukongSetup=Finetuning, Model Size=Base, Backbone=ViT-B/322022.11 | 83.9 | 97.6 | 99 | — | |
| CN-CLIPSetup=Zero-shot, Model Size=Large, Backbone=ViT-L/14, Resolution=336px2022.11 | 83.3 | 97.2 | 98.5 | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Finetuning2026.02 | 83.1 | 96.8 | 98.8 | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Finetuning2026.02 | 82.9 | 97.1 | 98.9 | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Zero-Shot2026.02 | 81.7 | 97.5 | 98.8 | — | |
| PTQ-P4Q (4bit)Backbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 81.7 | 86.3 | 98.5 | — | |
| CN-CLIPSetup=Zero-shot, Model Size=Huge, Backbone=ViT-H/142022.11 | 81.6 | 97.5 | 98.8 | — | |
| CN-CLIPModel Size=1B, Protocol=Zero-shot2024.01 | 81.6 | 97.5 | 98.8 | 89.3 | |
| BaselineBackbone=CN-CLIP (ViT-H/14), CR=0, Setting=Zero-Shot2026.02 | 81.6 | 97.5 | 98.8 | — | |
| PTQ-MinMax (4bit)Backbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 81.4 | 96.2 | 98.5 | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Zero-Shot2026.02 | 81 | 97.3 | 98.7 | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Zero-Shot2026.02 | 80.8 | 97.3 | 98.6 | — | |
| CN-CLIPBackbone=ViT-L, Zero-shot=true2022.11 | 80.2 | 96.6 | 98.2 | 87.9 | |
| CN-CLIPSetup=Zero-shot, Model Size=Large, Backbone=ViT-L/142022.11 | 80.2 | 96.6 | 98.2 | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Zero-Shot2026.02 | 79.5 | 96.8 | 98.5 | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Zero-Shot2026.02 | 79.5 | 96.7 | 98.3 | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Zero-Shot2026.02 | 79.1 | 96.7 | 98.4 | — | |
| FILIPBackbone=ViT-L, Zero-shot=true2022.02 | 78.9 | 96.2 | 98.1 | 83 | |
| FILIPBackbone=ViT-L, Zero-shot=true2022.05 | 78.9 | 96.2 | 98.1 | — | |
| SigLIP2Backbone=ViT-So/162026.02 | 78.4 | — | — | — | |
| R2D2Backbone=ViT-L, Zero-shot=true, Reported original results=true2022.11 | 77.6 | 96.7 | 98.9 | 85.6 | |
| R2D2Setup=Zero-shot, Model Size=Large, Backbone=ViT-L/142022.11 | 77.6 | 96.7 | 98.9 | — | |
| R2D2Backbone=ViT-L, Zero-shot=true2022.05 | 77.6 | 96.7 | 98.9 | — | |
| R2D2Model Size=0.4B, Protocol=Zero-shot2024.01 | 77.6 | 96.7 | 98.9 | 85.6 | |
| WukongBackbone=ViT-L, Zero-shot=true2022.02 | 76.1 | 94.8 | 97.5 | 80.9 | |
| WukongBackbone=ViT-L, Zero-shot=true, Reported original results=true2022.11 | 76.1 | 94.8 | 97.5 | 80.9 | |
| WukongSetup=Zero-shot, Model Size=Large, Backbone=ViT-L/142022.11 | 76.1 | 94.8 | 97.5 | — | |
| WukongBackbone=ViT-L, Zero-shot=true2022.05 | 76.1 | 94.8 | 97.5 | — | |
| WukongModel Size=0.4B, Protocol=Zero-shot2024.01 | 76.1 | 94.8 | 97.5 | 80.9 | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Zero-Shot2026.02 | 76.1 | 94.2 | 97.9 | — | |
| VLM2VecParameters=2B2026.02 | 76.1 | — | — | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Zero-Shot2026.02 | 75.8 | 94.1 | 97.9 | — | |
| CLIPBackbone=ViT-L, Zero-shot=true2022.02 | 75 | 94.5 | 97.7 | 80.6 | |
| CLIPBackbone=ViT-L, Zero-shot=true2022.05 | 75 | 94.5 | 97.7 | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Zero-Shot2026.02 | 74.9 | 93.6 | 97.3 | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Zero-Shot2026.02 | 74.7 | 93.7 | 97.2 | — | |
| CN-CLIPSetup=Zero-shot, Model Size=Base, Backbone=ViT-B/162022.11 | 74.6 | 93.5 | 97.1 | — | |
| CN-CLIPModel Size=0.2B, Protocol=Zero-shot2024.01 | 74.6 | 93.5 | 97.1 | 84.6 | |
| CLIPBackbone=ViT-B, Zero-shot=true2022.02 | 72.2 | 92 | 96.4 | 77.5 | |
| FILIP_ViT-BBackbone=ViT-B, Evaluation Protocol=Fine-tuned2022.02 | 72.1 | 91.3 | 95.8 | 81.9 | |
| WukongBackbone=ViT-B, Zero-shot=true2022.02 | 66.2 | 88.7 | 94.3 | 75.1 | |
| WukongSetup=Zero-shot, Model Size=Base, Backbone=ViT-B/322022.11 | 66.2 | 88.7 | 94.3 | — | |
| FILIPBackbone=Swin-L, Zero-shot=true2022.02 | 65.8 | 89.2 | 95 | 74.7 | |
| TaisuModel Size=0.2B, Protocol=Zero-shot2024.01 | 65.6 | 90.1 | 94.9 | 77.7 | |
| CLIPBackbone=Swin-L, Zero-shot=true2022.02 | 64.3 | 89.3 | 94.3 | 73.2 | |
| TaiyiBackbone=ViT-L, Zero-shot=true2022.11 | 63.8 | 90.5 | 95.9 | 78.4 | |
| TaiyiModel Size=0.3B, Protocol=Zero-shot2024.01 | 63.8 | 90.5 | 95.9 | 78.4 | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Zero-Shot2026.02 | 63.7 | 86.8 | 93.1 | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Zero-Shot2026.02 | 60.5 | 85.8 | 92.3 | — | |
| CN-CLIPSetup=Zero-shot, Model Size=Tiny, Backbone=ResNet-502022.11 | 60 | 85.9 | 92 | — | |
| WukongBackbone=Swin-L, Zero-shot=true2022.02 | 58.7 | 86.7 | 92.7 | 70.9 | |
| FILIPBackbone=ViT-B, Zero-shot=true2022.02 | 44.2 | 73.7 | 83.3 | 58.8 | |
| BriVLBackbone=N/A, Zero-shot=true2022.02 | 17.7 | 42.3 | 54.3 | 31.7 | |
| BriVLModel Size=1B, Protocol=Zero-shot2024.01 | 17.7 | 42.3 | 54.3 | 31.7 | |
| CLIPBackbone=ViT-L, Zero-shot=true2022.11 | 2.3 | 8.1 | 12.6 | 5 |