Text-to-Image Retrieval on Flickr30K-CN
84.4R@1R2D2
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| R2D2Setup=Finetuning, Model Size=Large, Backbone=ViT-L/142022.11 | 84.4 | 96.7 | 98.4 | — | — | |
| CN-CLIPSetup=Finetuning, Model Size=Large, Backbone=ViT-L/14, Resolution=336px2022.11 | 84.4 | 97.1 | 98.7 | — | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Finetuning2026.02 | 84.3 | 97.1 | 98.7 | — | — | |
| CN-CLIPSetup=Finetuning, Model Size=Huge, Backbone=ViT-H/142022.11 | 83.8 | 96.9 | 98.6 | — | — | |
| BaselineBackbone=CN-CLIP (ViT-H/14), CR=0, Setting=Finetuning2026.02 | 83.8 | 96.9 | 98.6 | — | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 83.4 | 96.9 | 98.5 | — | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Finetuning2026.02 | 83.1 | 96.7 | 98.5 | — | — | |
| CN-CLIPSetup=Finetuning, Model Size=Large, Backbone=ViT-L/142022.11 | 82.7 | 96.7 | 98.6 | — | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Finetuning2026.02 | 82.3 | 95.9 | 98.1 | — | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 81.8 | 95.8 | 97.9 | — | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 81.7 | 95.7 | 98 | — | — | |
| M2-EncoderModel Size=10B, Protocol=Zero-shot2024.01 | 81.5 | 96.2 | 98.5 | — | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 80.3 | 95.4 | 97.9 | — | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 79.2 | 94.8 | 97.3 | — | — | |
| CN-CLIPSetup=Finetuning, Model Size=Base, Backbone=ViT-B/162022.11 | 79.1 | 94.8 | 97.4 | — | — | |
| GMEParameters=7B2026.02 | 79.1 | — | — | — | — | |
| M2-EncoderModel Size=1B, Protocol=Zero-shot2024.01 | 78.6 | 94.8 | 97.6 | — | — | |
| Qwen3-VL-EmbeddingParameters=2B2026.02 | 78.6 | — | — | — | — | |
| R2D2Setup=Finetuning, Model Size=Base, Backbone=ViT-B2022.11 | 78.3 | 94.6 | 97 | — | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 77.5 | 93.8 | 96.9 | — | — | |
| Wukong_ViT-LBackbone=ViT-L, Evaluation Protocol=Fine-tuned2022.02 | 77.4 | 94.5 | 97 | 93.4 | — | |
| WukongSetup=Finetuning, Model Size=Large, Backbone=ViT-L/142022.11 | 77.4 | 94.5 | 97 | — | — | |
| CLIP_ViT-LBackbone=ViT-L, Evaluation Protocol=Fine-tuned2022.02 | 77.3 | 94.4 | 97.2 | 93.2 | — | |
| ObjEmbedParameters=4B2026.02 | 77.3 | — | — | — | — | |
| FG-CLIP2Backbone=ViT-So/162026.02 | 77.2 | — | — | — | — | |
| FILIP_ViT-LBackbone=ViT-L, Evaluation Protocol=Fine-tuned2022.02 | 76.9 | 94.9 | 97.4 | 93 | — | |
| ObjEmbedParameters=2B2026.02 | 76.1 | — | — | — | — | |
| UME-R1Parameters=2B2026.02 | 75 | — | — | — | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Finetuning2026.02 | 73.4 | 92.1 | 96 | — | — | |
| PTQ-P4Q (8bit)Backbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 73.1 | 91.6 | 95.6 | — | — | |
| PTQ-MinMax (8bit)Backbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Finetuning2026.02 | 72.8 | 91.5 | 95.5 | — | — | |
| M2-EncoderModel Size=0.4B, Protocol=Zero-shot2024.01 | 72.5 | 92.4 | 96.4 | — | — | |
| MetaCLIP2Backbone=ViT-H/142026.02 | 72.2 | — | — | — | — | |
| CN-CLIPSetup=Zero-shot, Model Size=Huge, Backbone=ViT-H/142022.11 | 71.2 | 91.4 | 95.5 | — | — | |
| CN-CLIPModel Size=1B, Protocol=Zero-shot2024.01 | 71.2 | 91.4 | 95.5 | — | — | |
| BaselineBackbone=CN-CLIP (ViT-H/14), CR=0, Setting=Zero-Shot2026.02 | 71.2 | 91.4 | 95.5 | — | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Zero-Shot2026.02 | 71.1 | 91.4 | 95.6 | — | — | |
| GMEParameters=2B2026.02 | 71.1 | — | — | — | — | |
| FILIP_Swin-LBackbone=Swin-L, Evaluation Protocol=Fine-tuned2022.02 | 70.9 | 91.3 | 95.3 | 90 | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Zero-Shot2026.02 | 70.2 | 90.8 | 95.2 | — | — | |
| AltCLIPBackbone=ViT-L, Zero-shot=true, Stage=Contrastive Learning2022.11 | 69.8 | 89.9 | 94.7 | 89.2 | — | |
| AltCLIPModel Size=0.8B, Protocol=Zero-shot2024.01 | 69.8 | 89.9 | 94.7 | — | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Zero-Shot2026.02 | 69.8 | 90.6 | 95 | — | — | |
| CLIP_ViT-BBackbone=ViT-B, Evaluation Protocol=Fine-tuned2022.02 | 69 | 90.3 | 95 | 89.7 | — | |
| CN-CLIPSetup=Zero-shot, Model Size=Large, Backbone=ViT-L/14, Resolution=336px2022.11 | 69 | 90.7 | 95.4 | — | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Zero-Shot2026.02 | 68.3 | 89.5 | 94.7 | — | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=50%, Setting=Zero-Shot2026.02 | 68.1 | 89.4 | 94.7 | — | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Zero-Shot2026.02 | 68.1 | 89.4 | 94.5 | — | — | |
| CN-CLIPBackbone=ViT-L, Zero-shot=true2022.11 | 68 | 89.7 | 94.4 | 87.9 | — | |
| CN-CLIPSetup=Zero-shot, Model Size=Large, Backbone=ViT-L/142022.11 | 68 | 89.7 | 94.4 | — | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Finetuning2026.02 | 67.8 | 89.4 | 93.7 | — | — | |
| Wukong_ViT-BBackbone=ViT-B, Evaluation Protocol=Fine-tuned2022.02 | 67.6 | 89.6 | 94.2 | 88.7 | — | |
| WukongSetup=Finetuning, Model Size=Base, Backbone=ViT-B/322022.11 | 67.6 | 89.6 | 94.2 | — | — | |
| CLIP_Swin-LBackbone=Swin-L, Evaluation Protocol=Fine-tuned2022.02 | 67.4 | 90.3 | 94.9 | 89.1 | — | |
| Wukong_Swin-LBackbone=Swin-L, Evaluation Protocol=Fine-tuned2022.02 | 67.4 | 89.9 | 94.5 | 89.3 | — | |
| VLM2Vec-V2Parameters=2B2026.02 | 67.1 | — | — | — | — | |
| CN-CLIPSetup=Finetuning, Model Size=Tiny, Backbone=ResNet-502022.11 | 66.7 | 89.4 | 94.1 | — | — | |
| PTQ-P4Q (4bit)Backbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 66.4 | 88.8 | 93.4 | — | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Finetuning2026.02 | 66.4 | 88.6 | 93.5 | — | — | |
| PTQ-MinMax (4bit)Backbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Finetuning2026.02 | 65.8 | 88.4 | 93.2 | — | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=75%, Setting=Zero-Shot2026.02 | 65.7 | 88.1 | 93.9 | — | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Zero-Shot2026.02 | 63.8 | 87.2 | 93.1 | — | — | |
| AltCLIPTBackbone=ViT-L, Zero-shot=true, Stage=Teacher Learning2022.11 | 63.7 | 86.3 | 92.1 | 87.2 | — | |
| CN-CLIPSetup=Zero-shot, Model Size=Base, Backbone=ViT-B/162022.11 | 62.7 | 86.9 | 92.8 | — | — | |
| CN-CLIPModel Size=0.2B, Protocol=Zero-shot2024.01 | 62.7 | 86.9 | 92.8 | — | — | |
| GRAPEBackbone=ViT-L/14, Method=+GRAPE2025.09 | 62.6 | — | 92.6 | — | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=87.5%, Setting=Zero-Shot2026.02 | 61.9 | 86.5 | 92.3 | — | — | |
| R2D2Backbone=ViT-L, Zero-shot=true, Reported original results=true2022.11 | 60.9 | 86.8 | 92.7 | 85.6 | — | |
| R2D2Setup=Zero-shot, Model Size=Large, Backbone=ViT-L/142022.11 | 60.9 | 86.8 | 92.7 | — | — | |
| R2D2Backbone=ViT-L, Zero-shot=true2022.05 | 60.9 | 86.8 | 92.7 | — | 85.6 | |
| R2D2Model Size=0.4B, Protocol=Zero-shot2024.01 | 60.9 | 86.8 | 92.7 | — | — | |
| Arbitrary Ratio Feature Compression (ARFC)Backbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Zero-Shot2026.02 | 60.5 | 85.2 | 91.4 | — | — | |
| GRAPEBackbone=ViT-B/16, Method=+GRAPE2025.09 | 58 | — | 90 | — | — | |
| CLIP + LLMBackbone=ViT-L/14, Method=+LLM2025.09 | 57.6 | — | 89.5 | — | — | |
| FILIP_ViT-BBackbone=ViT-B, Evaluation Protocol=Fine-tuned2022.02 | 57.5 | 84.3 | 90.6 | 81.9 | — | |
| VLM2VecParameters=2B2026.02 | 56.9 | — | — | — | — | |
| FILIPBackbone=ViT-L, Zero-shot=true2022.02 | 55.7 | 81.2 | 87.9 | 83 | — | |
| FILIPBackbone=ViT-L, Zero-shot=true2022.05 | 55.7 | 81.2 | 87.9 | — | 83 | |
| TaiyiBackbone=ViT-L, Zero-shot=true2022.11 | 53.7 | 79.8 | 86.6 | 78.4 | — | |
| TaiyiModel Size=0.3B, Protocol=Zero-shot2024.01 | 53.7 | 79.8 | 86.6 | — | — | |
| GRAPEBackbone=ViT-B/32, Method=+GRAPE2025.09 | 53.3 | — | 87.3 | — | — | |
| AutoEncoder-VAEBackbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Zero-Shot2026.02 | 52.5 | 79.1 | 86.9 | — | — | |
| CLIP + LLMBackbone=ViT-B/16, Method=+LLM2025.09 | 52.1 | — | 86 | — | — | |
| CLIPBackbone=ViT-L, Zero-shot=true2022.02 | 51.8 | 78.6 | 85.9 | 80.6 | — | |
| CLIPBackbone=ViT-L, Zero-shot=true2022.05 | 51.8 | 78.6 | 85.9 | — | 80.6 | |
| WukongBackbone=ViT-L, Zero-shot=true2022.02 | 51.7 | 78.9 | 86.3 | 80.9 | — | |
| WukongBackbone=ViT-L, Zero-shot=true, Reported original results=true2022.11 | 51.7 | 78.9 | 86.3 | 80.9 | — | |
| WukongSetup=Zero-shot, Model Size=Large, Backbone=ViT-L/142022.11 | 51.7 | 78.9 | 86.3 | — | — | |
| WukongBackbone=ViT-L, Zero-shot=true2022.05 | 51.7 | 78.9 | 86.3 | — | 80.9 | |
| WukongModel Size=0.4B, Protocol=Zero-shot2024.01 | 51.7 | 78.9 | 86.3 | — | — | |
| SigLIP2Backbone=ViT-So/162026.02 | 51.7 | — | — | — | — | |
| TaisuModel Size=0.2B, Protocol=Zero-shot2024.01 | 49.9 | 78.9 | 87 | — | — | |
| CLIP + LLMBackbone=ViT-B/32, Method=+LLM2025.09 | 49.8 | — | 84.4 | — | — | |
| Q-FormerBackbone=CN-CLIP (ViT-H/14), CR=93.75%, Setting=Zero-Shot2026.02 | 49.7 | 77.2 | 84.8 | — | — | |
| CN-CLIPSetup=Zero-shot, Model Size=Tiny, Backbone=ResNet-502022.11 | 48.8 | 76 | 84.6 | — | — | |
| CLIPBackbone=ViT-B, Zero-shot=true2022.02 | 47.2 | 74.1 | 82.9 | 77.5 | — | |
| WukongBackbone=ViT-B, Zero-shot=true2022.02 | 45.7 | 73.8 | 82.2 | 75.1 | — | |
| WukongSetup=Zero-shot, Model Size=Base, Backbone=ViT-B/322022.11 | 45.7 | 73.8 | 82.2 | — | — | |
| FILIPBackbone=Swin-L, Zero-shot=true2022.02 | 44.6 | 72.2 | 81.2 | 74.7 | — | |
| CLIPBackbone=Swin-L, Zero-shot=true2022.02 | 41.2 | 69.7 | 80.2 | 73.2 | — |