Text-to-image Retrieval on CUHK-PEDES (test)
78.37Recall@1CADA-L
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| CADA-LInference Protocol=Local-matching2023.12 | 78.37 | 91.57 | 94.58 | 68.87 | — | — | — | — | — | — | |
| ICLImage Enc.=CLIP-ViT, Text Enc.=CLIP-X., Interp.=No2026.04 | 78.18 | 91.63 | 94.83 | 69.58 | 53.48 | — | — | — | — | — | |
| InterPartAbilityImage Enc.=CLIP-ViT, Text Enc.=CLIP-X., Interp.=Yes2026.04 | 78.17 | 90.95 | 94.61 | 69.2 | 52.69 | — | — | — | — | — | |
| MARSImage Enc.=Swin-B, Text Enc.=BERT, Interp.=No2026.04 | 77.62 | 90.63 | 94.27 | 71.71 | — | — | — | — | — | — | |
| NAM♮Image Enc.=CLIP-ViT, Text Enc.=CLIP-X., Interp.=No2026.04 | 77.47 | 90.84 | 94.67 | 69.43 | 54.08 | — | — | — | — | — | |
| DiCOImage Enc.=CLIP-ViT, Text Enc.=CLIP-X., Interp.=Yes2026.04 | 77.21 | 91.85 | 95.63 | — | — | — | — | — | — | — | |
| APTMImage Enc.=Swin-B, Text Enc.=BERT, Interp.=No2026.04 | 76.53 | 90.04 | 94.15 | 66.91 | — | — | — | — | — | — | |
| PLOTImage Enc.=CLIP-ViT, Text Enc.=CLIP-X., Interp.=Yes2026.04 | 75.28 | 90.42 | 94.12 | — | — | — | — | — | — | — | |
| IRRA♭Image Enc.=CLIP-ViT, Text Enc.=CLIP-X., Interp.=No2026.04 | 74.05 | 89.48 | 93.64 | 66.57 | — | — | — | — | — | — | |
| CADA-GInference Protocol=Global-matching2023.12 | 73.48 | 89.57 | 94.1 | 65.82 | — | — | — | — | — | — | |
| IRRAType=Global-matching, Image Encoder=CLIP-ViT, Text Encoder=CLIP-Xformer2023.03 | 73.38 | 89.93 | 93.71 | 66.13 | 50.24 | — | — | — | — | — | |
| IRRAInference Protocol=Global-matching, Reference=CVPR232023.12 | 73.38 | 89.93 | 93.71 | 66.13 | — | — | — | — | — | — | |
| RaSa_TCLVision-Language Pre-training (VLP)=True, Backbone=TCL2023.05 | 73.23 | 89.2 | 93.32 | 66.43 | — | — | — | — | — | — | |
| CFineType=Local-matching, Image Encoder=CLIP-ViT, Text Encoder=BERT2023.03 | 69.57 | 85.93 | 91.15 | — | — | — | — | — | — | — | |
| CFineVision-Language Pre-training (VLP)=True2023.05 | 69.57 | 85.93 | 91.15 | — | — | — | — | — | — | — | |
| CFineInference Protocol=Global-matching, Reference=arXiv222023.12 | 69.57 | 85.93 | 91.15 | — | — | — | — | — | — | — | |
| ACSAInference Protocol=Local-matching, Reference=TMM222023.12 | 68.67 | 85.61 | 90.66 | — | — | — | — | — | — | — | |
| Baseline (CLIP-ViT-B/16)Type=Global-matching, Image Encoder=CLIP-ViT, Text Encoder=CLIP-Xformer2023.03 | 68.19 | 86.47 | 91.47 | 61.12 | 44.86 | — | — | — | — | — | |
| IVTType=Global-matching, Image Encoder=ViT-Base, Text Encoder=BERT2023.03 | 65.59 | 83.11 | 89.21 | — | — | — | — | — | — | — | |
| IVTVision-Language Pre-training (VLP)=True2023.05 | 65.59 | 83.11 | 89.21 | — | — | — | — | — | — | — | |
| LGURType=Local-matching, Image Encoder=DeiT-Small, Text Encoder=BERT2023.03 | 65.25 | 83.12 | 89 | — | — | — | — | — | — | — | |
| LGURVision-Language Pre-training (VLP)=False2023.05 | 65.25 | 83.12 | 89 | — | — | — | — | — | — | — | |
| LGURInference Protocol=Local-matching, Reference=MM222023.12 | 65.25 | 83.12 | 89 | — | — | — | — | — | — | — | |
| C2A2Vision-Language Pre-training (VLP)=False2023.05 | 64.82 | 83.54 | 89.77 | — | — | — | — | — | — | — | |
| AXM-NetType=Local-matching, Image Encoder=RN50, Text Encoder=BERT2023.03 | 64.44 | 80.52 | 86.77 | 58.73 | — | — | — | — | — | — | |
| AXM-NetInference Protocol=Local-matching, Reference=AAAI222023.12 | 64.44 | 80.52 | 86.77 | 58.73 | — | — | — | — | — | — | |
| CAIBCType=Local-matching, Image Encoder=RN50, Text Encoder=BERT2023.03 | 64.43 | 82.87 | 88.37 | — | — | — | — | — | — | — | |
| CAIBCVision-Language Pre-training (VLP)=False2023.05 | 64.43 | 82.87 | 88.37 | — | — | — | — | — | — | — | |
| CAIBCInference Protocol=Local-matching, Reference=MM222023.12 | 64.43 | 82.87 | 88.37 | — | — | — | — | — | — | — | |
| CM-MoCo (ResNet101)Arch=Single-scale, Dim=256, Reranking=true2021.10 | 64.4 | 81.27 | 87.96 | 61.19 | — | — | — | — | — | — | |
| TIPCBType=Local-matching, Image Encoder=RN50, Text Encoder=BERT2023.03 | 64.26 | 83.19 | 89.1 | — | — | — | — | — | — | — | |
| TIPCBVision-Language Pre-training (VLP)=False2023.05 | 64.26 | 83.19 | 89.1 | — | — | — | — | — | — | — | |
| TIPCBInference Protocol=Local-matching, Reference=Neuro222023.12 | 64.26 | 83.19 | 89.1 | — | — | — | — | — | — | — | |
| SAFType=Local-matching, Image Encoder=ViT-Base, Text Encoder=BERT2023.03 | 64.13 | 82.62 | 88.4 | — | — | — | — | — | — | — | |
| SAFVision-Language Pre-training (VLP)=False2023.05 | 64.13 | 82.62 | 88.4 | 58.61 | — | — | — | — | — | — | |
| SAFInference Protocol=Local-matching, Reference=ICASSP222023.12 | 64.13 | 82.62 | 88.4 | — | — | — | — | — | — | — | |
| CM-MoCo (ResNet101)Arch=Single-scale, Dim=256, Reranking=false2021.10 | 64.08 | 81.73 | 88.19 | 60.08 | — | — | — | — | — | — | |
| Han et al.Type=Global-matching, Image Encoder=CLIP-RN101, Text Encoder=CLIP-Xformer2023.03 | 64.08 | 81.73 | 88.19 | 60.08 | — | — | — | — | — | — | |
| PSLDVision-Language Pre-training (VLP)=True2023.05 | 64.08 | 81.73 | 88.19 | 60.08 | — | — | — | — | — | — | |
| TextReIDInference Protocol=Global-matching, Reference=BMVC212023.12 | 64.08 | 81.73 | 88.19 | 60.08 | — | — | — | — | — | — | |
| LBULType=Local-matching, Image Encoder=RN50, Text Encoder=BERT2023.03 | 64.04 | 82.66 | 87.22 | — | — | — | — | — | — | — | |
| LBULInference Protocol=Local-matching, Reference=MM222023.12 | 64.04 | 82.66 | 87.22 | — | — | — | — | — | — | — | |
| IVTInference Protocol=Global-matching, Reference=ECCVW222023.12 | 64 | 82.72 | 88.95 | — | — | — | — | — | — | — | |
| ISANetType=Local-matching, Image Encoder=RN50, Text Encoder=LSTM2023.03 | 63.92 | 82.15 | 87.69 | — | — | — | — | — | — | — | |
| TIPCBArch=Multi-scale, Dim=2048, Reranking=false2021.10 | 63.63 | 82.82 | 89.01 | 56.78 | — | — | — | — | — | — | |
| ACSAVision-Language Pre-training (VLP)=False2023.05 | 63.56 | 81.4 | 87.7 | — | — | — | — | — | — | — | |
| LapsCoreType=Local-matching, Image Encoder=RN50, Text Encoder=BERT2023.03 | 63.4 | — | 87.8 | — | — | — | — | — | — | — | |
| LapsCoreInference Protocol=Local-matching, Reference=ICCV212023.12 | 63.4 | — | 87.8 | — | — | — | — | — | — | — | |
| TIPCBArch=Multi-scale, Dim=2048, Reranking=true2021.10 | 63.37 | 81.56 | 87.57 | 60.02 | — | — | — | — | — | — | |
| CM-MoCo (ResNet50)Arch=Single-scale, Dim=256, Reranking=true2021.10 | 61.94 | 80.52 | 86.45 | 59.45 | — | — | — | — | — | — | |
| AXM-NetArch=Multi-scale, Dim=512, Reranking=false2021.10 | 61.9 | 79.41 | 85.75 | 57.38 | — | — | — | — | — | — | |
| CM-MoCo (ResNet50)Arch=Single-scale, Dim=256, Reranking=false2021.10 | 61.65 | 80.98 | 86.78 | 58.29 | — | — | — | — | — | — | |
| SSANType=Local-matching, Image Encoder=RN50, Text Encoder=LSTM2023.03 | 61.37 | 80.15 | 86.73 | — | — | — | — | — | — | — | |
| SSANInference Protocol=Local-matching, Reference=arXiv212023.12 | 61.37 | 80.15 | 86.73 | — | — | — | — | — | — | — | |
| MGELArch=Multi-scale, Dim=512, Reranking=false2021.10 | 60.27 | 80.01 | 86.74 | — | — | — | — | — | — | — | |
| Baseline (CLIP-RN101)Type=Global-matching, Image Encoder=CLIP-RN101, Text Encoder=CLIP-Xformer2023.03 | 60.27 | 80.88 | 87.88 | 53.93 | 37.54 | — | — | — | — | — | |
| MGELVision-Language Pre-training (VLP)=False2023.05 | 60.27 | 80.01 | 86.74 | — | — | — | — | — | — | — | |
| DSSLType=Local-matching, Image Encoder=RN50, Text Encoder=BERT2023.03 | 59.98 | 80.41 | 87.56 | — | — | — | — | — | — | — | |
| DSSLVision-Language Pre-training (VLP)=False2023.05 | 59.98 | 80.41 | 87.56 | — | — | — | — | — | — | — | |
| DSSLInference Protocol=Local-matching, Reference=MM212023.12 | 59.98 | 80.41 | 87.56 | — | — | — | — | — | — | — | |
| NAFSInference Protocol=Local-matching, Reference=arXiv212023.12 | 59.94 | 79.86 | 86.7 | 54.07 | — | — | — | — | — | — | |
| NAFS (G)Arch=Multi-scale, Dim=768, Reranking=true2021.10 | 59.62 | 78.9 | 85.72 | 55.02 | — | — | — | — | — | — | |
| NAFS (G)Arch=Multi-scale, Dim=768, Reranking=false2021.10 | 59.36 | 79.13 | 86 | 54.07 | — | — | — | — | — | — | |
| NAFSType=Local-matching, Image Encoder=RN50, Text Encoder=BERT2023.03 | 59.36 | 79.13 | 86 | 54.07 | — | — | — | — | — | — | |
| HGANArch=Multi-scale, Dim=512, Reranking=false2021.10 | 59 | 79.49 | 86.62 | — | — | — | — | — | — | — | |
| RaSa_CLIPVision-Language Pre-training (VLP)=True, Backbone=CLIP2023.05 | 57.6 | 78.09 | 84.91 | 55.52 | — | — | — | — | — | — | |
| TCLVision-Language Pre-training (VLP)=True, Backbone=TCL2023.05 | 57.6 | 77.14 | 84.39 | 53.64 | — | — | — | — | — | — | |
| Baseline (CLIP-RN50)Type=Global-matching, Image Encoder=CLIP-RN50, Text Encoder=CLIP-Xformer2023.03 | 57.26 | 78.57 | 85.58 | 50.88 | 34.44 | — | — | — | — | — | |
| CMAAMArch=Multi-scale, Dim=512, Reranking=false2021.10 | 56.68 | 77.18 | 84.86 | — | — | — | — | — | — | — | |
| VITAAVision-Language Pre-training (VLP)=False2023.05 | 55.97 | 75.84 | 83.52 | — | — | — | — | — | — | — | |
| VITAAInference Protocol=Local-matching, Reference=ECCV202023.12 | 55.97 | 75.84 | 83.52 | 51.6 | — | — | — | — | — | — | |
| SCANInference Protocol=Local-matching, Reference=ECCV182023.12 | 55.86 | 75.97 | 83.69 | — | — | — | — | — | — | — | |
| ViTAAArch=Multi-scale, Dim=256, Reranking=false2021.10 | 54.92 | 75.18 | 82.9 | 51.6 | — | — | — | — | — | — | |
| ViTAAArch=Multi-scale, Dim=256, Reranking=true2021.10 | 54.92 | 74.77 | 82.49 | 52.6 | — | — | — | — | — | — | |
| ViTAAType=Local-matching, Image Encoder=RN50, Text Encoder=LSTM2023.03 | 54.92 | 75.18 | 82.9 | 51.6 | — | — | — | — | — | — | |
| CKMAArch=Single-scale, Dim=512, Reranking=false2021.10 | 54.69 | 73.65 | 81.86 | — | — | — | — | — | — | — | |
| TIMAM+Arch=Single-scale, Dim=512, Reranking=false2021.10 | 54.51 | 77.56 | 84.78 | — | — | — | — | — | — | — | |
| TIMAMType=Global-matching, Image Encoder=RN101, Text Encoder=BERT2023.03 | 54.51 | 77.56 | 79.27 | — | — | — | — | — | — | — | |
| PMAArch=Multi-scale, Dim=1024, Reranking=false2021.10 | 54.12 | 75.45 | 82.97 | — | — | — | — | — | — | — | |
| A-GANetInference Protocol=Global-matching, Reference=MM192023.12 | 53.14 | 74.03 | 81.95 | — | — | — | — | — | — | — | |
| MIAArch=Multi-scale, Dim=1024, Reranking=false2021.10 | 53.1 | 75 | 82.9 | — | — | — | — | — | — | — | |
| MIAInference Protocol=Local-matching, Reference=TIP202023.12 | 53.1 | 75 | 82.9 | — | — | — | — | — | — | — | |
| CMPM/C+Arch=Single-scale, Dim=512, Reranking=false2021.10 | 49.37 | 71.69 | 79.27 | — | — | — | — | — | — | — | |
| CMPM/CType=Local-matching, Image Encoder=RN50, Text Encoder=LSTM2023.03 | 49.37 | — | 79.27 | — | — | — | — | — | — | — | |
| CMPM/CVision-Language Pre-training (VLP)=False2023.05 | 49.37 | 71.69 | 79.27 | — | — | — | — | — | — | — | |
| CMPM/CMPCInference Protocol=Local-matching, Reference=ECCV182023.12 | 49.37 | — | 79.27 | — | — | — | — | — | — | — | |
| DP-GCLepsilon=102026.04 | 48.1 | — | — | — | — | — | — | — | — | — | |
| DPCE2018.08 | 44.4 | 66.26 | 75.07 | — | — | — | — | — | — | — | |
| Dual PathArch=Single-scale, Dim=2048, Reranking=false2021.10 | 44.4 | 66.26 | 75.07 | — | — | — | — | — | — | — | |
| Dual PathVision-Language Pre-training (VLP)=False2023.05 | 44.4 | 66.26 | 75.07 | — | — | — | — | — | — | — | |
| Dual PathInference Protocol=Global-matching, Reference=TOMM202023.12 | 44.4 | 66.26 | 75.07 | — | — | — | — | — | — | — | |
| Global and Local Image-language Association2018.08 | 43.58 | 66.93 | 76.26 | — | — | — | — | — | — | — | |
| CLIPVision-Language Pre-training (VLP)=True, Backbone=CLIP2023.05 | 43.05 | 66.41 | 76.36 | 38.91 | — | — | — | — | — | — | |
| OursTraining Set=ICFG-PEDES2026.01 | 41.05 | 63.3 | 72.08 | 37.79 | — | — | — | — | — | — | |
| OursTraining Set=RSTPReid2026.01 | 40.32 | 61.7 | 71.04 | 36.65 | — | — | — | — | — | — | |
| DP-GCLepsilon=12026.04 | 40 | — | — | — | — | — | — | — | — | — | |
| RDETraining Set=ICFG-PEDES2026.01 | 38.11 | 59.24 | 68.44 | 34.16 | — | — | — | — | — | — | |
| RDETraining Set=RSTPReid2026.01 | 36.94 | 58.22 | 67.58 | 33.65 | — | — | — | — | — | — | |
| CLIPTraining Set=RSTPReid2026.01 | 35.25 | — | — | 32.35 | — | — | — | — | — | — | |
| CLIPTraining Set=ICFG-PEDES2026.01 | 33.9 | — | — | 31.65 | — | — | — | — | — | — |