Text-based Person Retrieval on ICFG-PEDES
70.52R@1HAM(RDE) + MVR
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| HAM(RDE) + MVRVenue=-2026.04 | 70.52 | 84.2 | 88.67 | 43.35 | |
| HAM(RDE)Venue=CVPR '252026.04 | 69.95 | 83.88 | 88.39 | 42.72 | |
| AULVenue=AAAI '242026.04 | 69.16 | 83.32 | 88.37 | — | |
| HAM(IRRA) + MVRVenue=-2026.04 | 68.6 | 83.17 | 87.78 | 42.58 | |
| APTMPre-training on MALS=true2023.06 | 68.51 | 82.99 | 87.56 | 41.22 | |
| APTMVenue=ACM MM '232026.04 | 68.51 | 82.99 | 87.56 | 41.22 | |
| F-WoRAVenue=WWW '252026.04 | 68.35 | 83.1 | 87.53 | 42.6 | |
| HAM(IRRA)Venue=CVPR '252026.04 | 68.25 | 82.88 | 87.69 | 41.84 | |
| APTMImage Backbone=Swin-B, Text Backbone=BERT2023.05 | 68.22 | 82.87 | 87.5 | — | |
| RDE + MVRVenue=-2026.04 | 68.11 | 82.48 | 87.4 | 40.6 | |
| RDEVenue=CVPR '242026.04 | 67.68 | 82.47 | 87.36 | 40.06 | |
| CADAVenue=TMM '242026.04 | 67.38 | 81.34 | 85.64 | 37.81 | |
| PLIPImage Backbone=Swin-B, Text Backbone=BERT2023.05 | 66.17 | 83.37 | 88.94 | — | |
| PLOTVenue=ECCV '242026.04 | 65.76 | 81.39 | 86.73 | — | |
| UMSAVenue=AAAI '242026.04 | 65.62 | 80.54 | 85.83 | 38.78 | |
| PLIPImage Backbone=RN152, Text Backbone=BERT2023.05 | 65.52 | 82.64 | 88.4 | — | |
| RaSaImage Backbone=ViT-B, Text Backbone=BERT2023.05 | 65.28 | 80.4 | 85.12 | — | |
| RaSaVenue=IJCAI '232026.04 | 65.28 | 80.4 | 85.12 | 41.29 | |
| PropotVenue=ACM MM '242026.04 | 65.12 | 81.57 | 86.97 | 42.93 | |
| TBPS-CLIPVenue=AAAI '242026.04 | 65.05 | 80.34 | 85.47 | 39.83 | |
| PLIPImage Backbone=RN101, Text Backbone=BERT2023.05 | 64.92 | 81.63 | 87.66 | — | |
| PLIPImage Backbone=RN50, Text Backbone=BERT2023.05 | 64.88 | 81.7 | 87.32 | — | |
| DCELVenue=ACM MM '232026.04 | 64.88 | 81.34 | 86.72 | — | |
| IRLTVenue=AAAI '242026.04 | 64.72 | 81.35 | 86.31 | — | |
| PLIPEvaluation Protocol=fine-tune, Visual Encoder=ResNet-50, Training Target=CMPM loss2023.05 | 64.58 | 81.3 | 86.82 | — | |
| IRRA + MVRVenue=-2026.04 | 64.51 | 80.4 | 85.83 | 38.7 | |
| LSPMVenue=TMM '242026.04 | 64.4 | 79.96 | 85.41 | 42.6 | |
| FSRLVenue=ICMR '242026.04 | 64.01 | 80.42 | 85.56 | 39.64 | |
| CFAMVenue=CVPR '242026.04 | 63.57 | 80.57 | 86.32 | 38.34 | |
| IRRAImage Backbone=ViT-B, Text Backbone=Xformer2023.05 | 63.46 | 80.25 | 85.82 | — | |
| IRRAVenue=CVPR '232026.04 | 63.46 | 80.25 | 85.82 | 38.06 | |
| LuPerson-HAM + Ours (UATTA)Adaptation Paradigm=Pretrain-then-Adapt (Pre-Adp), Adaptation Rounds=102026.04 | 62.15 | 77.31 | 82.95 | 36.11 | |
| CFine2023.06 | 60.83 | 76.55 | 82.42 | — | |
| CFineImage Backbone=ViT-B, Text Backbone=BERT2023.05 | 60.83 | 76.55 | 82.42 | — | |
| CFineVenue=TIP '232026.04 | 60.83 | 76.55 | 82.42 | — | |
| LuPerson-HAMAdaptation Paradigm=Pure pretraining (no adaptation / finetuning)2026.04 | 60.64 | 77.5 | 83.26 | 35.54 | |
| LuPerson-HAM + SARAdaptation Paradigm=Pretrain-then-Adapt (Pre-Adp), Adaptation Rounds=102026.04 | 60.64 | 77.5 | 83.25 | 35.54 | |
| VGSGVenue=TIP '232026.04 | 60.64 | 76.01 | 82.01 | — | |
| LuPerson-HAM + READAdaptation Paradigm=Pretrain-then-Adapt (Pre-Adp), Adaptation Rounds=102026.04 | 60.31 | 77.09 | 82.96 | 35.27 | |
| LuPerson-HAM + SHOTAdaptation Paradigm=Pretrain-then-Adapt (Pre-Adp), Adaptation Rounds=102026.04 | 60.31 | 76.95 | 82.86 | 35.1 | |
| LuPerson-HAM + CoOpAdaptation Paradigm=Pretrain-then-Adapt (Pre-Adp), Adaptation Rounds=102026.04 | 60.28 | 76.24 | 82.31 | 35.16 | |
| UniPTVenue=ICCV '232026.04 | 60.09 | 76.19 | 82.46 | — | |
| LuPerson-HAM + TentAdaptation Paradigm=Pretrain-then-Adapt (Pre-Adp), Adaptation Rounds=102026.04 | 59.59 | 76.89 | 82.85 | 34.86 | |
| LuPerson-HAM + TCRAdaptation Paradigm=Pretrain-then-Adapt (Pre-Adp), Adaptation Rounds=102026.04 | 59.32 | 75.63 | 81.63 | 35.13 | |
| LGUR2023.06 | 59.02 | 75.32 | 81.56 | — | |
| LGURVenue=ACM MM '222026.04 | 59.02 | 75.32 | 81.56 | — | |
| PLIPEvaluation Protocol=linear-probing, Visual Encoder=ResNet-50, Training Target=CMPM loss2023.05 | 58.51 | 77.83 | 84.24 | — | |
| LCR2SVenue=ACM MM '232026.04 | 57.93 | 76.08 | 82.4 | 38.21 | |
| LuPerson-MLLMAdaptation Paradigm=Pure pretraining (no adaptation / finetuning)2026.04 | 57.61 | 75.99 | 82.76 | 51.45 | |
| BaselinePre-training on MALS=false2023.06 | 57.49 | 75.84 | 82.6 | 32.41 | |
| LGURImage Backbone=RN50, Text Backbone=BERT2023.05 | 57.42 | 74.97 | 81.45 | — | |
| LGURBackbone=ResNet-502023.05 | 57.42 | 74.97 | 81.45 | — | |
| SYNTH-PEDESAdaptation Paradigm=Pure pretraining (no adaptation / finetuning)2026.04 | 57.08 | — | — | 32.06 | |
| IVT2023.06 | 56.04 | 73.6 | 80.22 | — | |
| IVTImage Backbone=ViT-B, Text Backbone=BERT2023.05 | 56.04 | 73.6 | 80.22 | — | |
| TIPCBImage Backbone=RN50, Text Backbone=BERT2023.05 | 54.96 | 74.72 | 81.89 | — | |
| TIPCBBackbone=ResNet-502023.05 | 54.96 | 74.72 | 81.89 | — | |
| SSAN2023.06 | 54.23 | 72.63 | 79.53 | — | |
| SSANImage Backbone=RN50, Text Backbone=LSTM2023.05 | 54.23 | 72.63 | 79.53 | — | |
| SSANBackbone=ResNet-502023.05 | 54.23 | 72.63 | 79.53 | — | |
| VITAA2023.06 | 50.98 | 68.79 | 75.78 | — | |
| VITAAImage Backbone=RN50, Text Backbone=LSTM2023.05 | 50.98 | 68.79 | 75.78 | — | |
| ViTAABackbone=ResNet-502023.05 | 50.98 | 68.79 | 75.78 | — | |
| SCAN2023.06 | 50.05 | 69.65 | 77.21 | — | |
| PLIPEvaluation Protocol=zero-shot, Visual Encoder=ResNet-502023.05 | 49.86 | 68.78 | 76.27 | — | |
| MIA2023.06 | 46.49 | 67.14 | 75.18 | — | |
| Generation-then-RetrievalAdaptation Paradigm=Semi-supervised Domain Adaptation2026.04 | 46.46 | — | — | 26.9 | |
| CMPM+CMPC2023.06 | 43.51 | 65.44 | 74.26 | — | |
| CMPM/CImage Backbone=RN50, Text Backbone=LSTM2023.05 | 43.51 | 65.44 | 74.26 | — | |
| Dual Path2023.06 | 38.99 | 59.44 | 68.41 | — | |
| PSPDAdaptation Paradigm=Unsupervised Domain Adaptation2026.04 | 38.49 | 53.4 | 60.35 | 16.49 | |
| MUMAAdaptation Paradigm=Unsupervised Domain Adaptation2026.04 | 38.11 | 56.01 | 63.96 | 19.02 | |
| GTRAdaptation Paradigm=Unsupervised Domain Adaptation2026.04 | 29.64 | 47.23 | 55.54 | 14.2 | |
| GAAPAdaptation Paradigm=Unsupervised Domain Adaptation2026.04 | 27.12 | 44.91 | 53.56 | 11.43 | |
| CLIPAdaptation Paradigm=Pure pretraining (no adaptation / finetuning)2026.04 | 13.45 | 33.85 | — | 10.31 | |
| LuPerson-TAdaptation Paradigm=Pure pretraining (no adaptation / finetuning)2026.04 | 11.46 | — | — | 4.56 |