Text Retrieval on MS-COCO 1K (test)
91.2R@1AlignCMSS
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AlignCMSS2023.09 | 91.2 | 99.4 | 99.8 | — | |
| OSCAR+ w/ VINVLBERT scale=Large2021.01 | 90.8 | 99 | 99.8 | — | |
| OSCARModel Size=Large2020.04 | 89.8 | 98.8 | 99.7 | — | |
| OSCARSize=L2020.04 | 89.8 | 98.8 | 99.7 | — | |
| OSCAR+ w/ VINVLBERT scale=Base2021.01 | 89.8 | 98.8 | 99.7 | — | |
| VinVL2023.09 | 89.8 | 98.8 | 99.7 | — | |
| OSCARModel Size=Base2020.04 | 88.4 | 99.1 | 99.8 | — | |
| OSCARSize=B2020.04 | 88.4 | 99.1 | 99.8 | — | |
| OscarBERT scale=Base2021.01 | 88.4 | 99.1 | 99.8 | — | |
| ALADIN A/ft.Training Data=8.9M, head=alignment2022.07 | 88.1 | 99.1 | 99.7 | — | |
| ALADIN A/ft. + D/ft.Training Data=8.9M, head=alignment, distillation=true2022.07 | 87.6 | 98.5 | 99.7 | — | |
| ALADIN T/ft.Training Data=8.9M2022.07 | 84.9 | 98.5 | 99.6 | — | |
| ALADIN A/ft. + D/ft.Training Data=8.9M2022.07 | 84.7 | 98 | 99.8 | — | |
| Unicoder-VLModel Size=Base2020.04 | 84.3 | 97.3 | 99.3 | — | |
| Unicoder-VLSize=B2020.04 | 84.3 | 97.3 | 99.3 | — | |
| Unicoder-VLBERT scale=Base2021.01 | 84.3 | 97.3 | 99.3 | — | |
| Unicoder-VLTraining Data=3.8M2022.07 | 84.3 | 97.3 | 99.3 | — | |
| ALADIN DTraining Data=8.9M2022.07 | 83.1 | 97.4 | 99.3 | — | |
| CODERImage Encoder=Faster-RCNN, Text Encoder=BERT2022.08 | 82.1 | 96.6 | 98.8 | 530.6 | |
| DSRANTraining Data=0.6M, Backbone=BERT2022.07 | 80.6 | 96.7 | 98.7 | — | |
| TERANTraining Data=0.6M, Ensemble=true2022.07 | 80.2 | 96.6 | 99 | — | |
| SGRAFTraining strategy=independent training2021.01 | 79.6 | 96.2 | 98.5 | — | |
| SGRAFImage Encoder=Faster-RCNN2022.08 | 79.6 | 96.2 | 98.5 | 524.3 | |
| ALADIN TTraining Data=8.9M2022.07 | 79.2 | 96.7 | 99.1 | — | |
| GPOImage Encoder=Faster-RCNN, Text Encoder=BERT2022.08 | 78.6 | 96.2 | 98.7 | 523.3 | |
| SGR2021.01 | 78 | 95.8 | 98.2 | — | |
| DIME (i-t)Image Encoder=Faster-RCNN, Text Encoder=BERT2022.08 | 77.9 | 95.9 | 98.3 | 521.8 | |
| CAMERATraining Data=0.6M, Ensemble=true2022.07 | 77.5 | 96.3 | 98.8 | — | |
| DSRANImage Encoder=Faster-RCNN, Text Encoder=BERT2022.08 | 77.1 | 95.3 | 98.1 | 518.6 | |
| SHANImage Encoder=Faster-RCNN2022.08 | 76.8 | 96.3 | 98.7 | 519.5 | |
| IMRAM2021.01 | 76.7 | 95.6 | 98.5 | — | |
| IMRAMImage Encoder=Faster-RCNN2022.08 | 76.7 | 95.6 | 98.5 | 516.6 | |
| SCG2020.04 | 76.6 | 96.3 | 99.2 | — | |
| SCG2020.04 | 76.6 | 96.3 | 99.2 | — | |
| PFAN2020.04 | 76.5 | 96.3 | 99 | — | |
| PFAN2020.04 | 76.5 | 96.3 | 99 | — | |
| PFAN2021.01 | 76.5 | 96.3 | 99 | — | |
| VSRN2021.01 | 76.2 | 94.8 | 98.2 | — | |
| VSRNImage Encoder=Faster-RCNN2022.08 | 76.2 | 94.8 | 98.2 | 516.8 | |
| SAF2021.01 | 76.1 | 95.4 | 98.3 | — | |
| CAAN2021.01 | 75.5 | 95.4 | 98.5 | — | |
| WCGLImage Encoder=Faster-RCNN2022.08 | 75.4 | 95.5 | 98.6 | 514.9 | |
| DPRNN2021.01 | 75.3 | 95.8 | 98.6 | — | |
| BFAN2021.01 | 74.9 | 95.2 | — | — | |
| MMCA2021.01 | 74.8 | 95.6 | 97.7 | — | |
| CVSEImage Encoder=Faster-RCNN2022.08 | 74.8 | 95.1 | 98.3 | 512.7 | |
| RDAN2021.01 | 74.6 | 96.2 | 98.7 | — | |
| VSRN*Model Type=single model2021.01 | 74 | 94.3 | 97.8 | — | |
| SGM2021.01 | 73.4 | 93.8 | 97.8 | — | |
| SCAN2020.04 | 72.7 | 94.8 | 98.4 | — | |
| SCAN2020.04 | 72.7 | 94.8 | 98.4 | — | |
| SCAN2021.01 | 72.7 | 94.8 | 98.4 | — | |
| SCANImage Encoder=Faster-RCNN2022.08 | 72.7 | 94.8 | 98.4 | 507.9 | |
| CAMP2020.04 | 72.3 | 94.8 | 98.3 | — | |
| CAMP2020.04 | 72.3 | 94.8 | 98.3 | — | |
| CAMP2021.01 | 72.3 | 94.8 | 98.3 | — | |
| SAEMTraining Data=0.6M, Ensemble=true2022.07 | 71.2 | 94.1 | 97.7 | — | |
| PVSEImage Encoder=Faster-RCNN2022.08 | 69.2 | 91.6 | 96.6 | 492.8 | |
| DPC2020.04 | 65.6 | 89.8 | 95.5 | — | |
| DPC2020.04 | 65.6 | 89.8 | 95.5 | — | |
| TERNTraining Data=0.6M2022.07 | 65.5 | 91 | 96.5 | — | |
| VSE++2020.04 | 64.7 | — | 95.9 | — | |
| VSE++2020.04 | 64.7 | — | 95.9 | — | |
| VSE++Image Encoder=ResNet-1522022.08 | 64.7 | — | 95.9 | — | |
| DSPEImage Encoder=VGG-192022.08 | 50.1 | 79.7 | 89.2 | 420.7 | |
| m-CNNImage Encoder=VGG-192022.08 | 42.8 | 73.1 | 84.1 | 384 | |
| DVSA2020.04 | 38.4 | 69.9 | 80.5 | — | |
| DVSA2020.04 | 38.4 | 69.9 | 80.5 | — | |
| DVSAImage Encoder=R-CNN2022.08 | 38.4 | 69.9 | 80.5 | 351.2 |