Image-text Retrieval on RSITMD
28.76R@1 (I2T)RemoteCLIP (ViT-L)
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| RemoteCLIP (ViT-L)Vision Backbone=ViT-L, Finetuning Data=RET-3 + DET-10 + SEG-4, Total Params (M)=4282025.12 | 28.76 | 52.43 | 63.94 | 23.76 | 59.51 | 74.73 | 50.52 | — | — | |
| RemoteCLIP (ViT-B)Vision Backbone=ViT-B, Finetuning Data=RET-3 + DET-10 + SEG-4, Total Params (M)=1512025.12 | 27.88 | 50.66 | 65.71 | 22.17 | 56.46 | 73.41 | 49.38 | — | — | |
| GeoMELTVision Backbone=MWT, Finetuning Data=Multi-Task Data, Total Params (M)=2712025.12 | 25.66 | 53.98 | 67.7 | 25.8 | 60.35 | 76.24 | 51.62 | — | — | |
| GeoRSCLIPVision Backbone=ViT-B, Finetuning Data=RS5M + RSICD + RSITMD, Total Params (M)=1512025.12 | 25.04 | 57.88 | 74.38 | 32.3 | 53.32 | 67.92 | 51.81 | — | — | |
| CLIP-RSICDVision Backbone=ViT-B, Finetuning Data=RSICD, Total Params (M)=1512025.12 | 25 | 46.46 | 61.73 | 19.29 | 51.02 | 68.45 | 45.32 | — | — | |
| Rahhal et al.Vision Backbone=ViT-B, Finetuning Data=RSITMD, Total Params (M)=1512025.12 | 19.69 | 40.26 | 54.42 | 17.61 | 49.73 | 66.59 | 41.38 | — | — | |
| GaLRVision Backbone=ResNet18, Finetuning Data=RSITMD, Total Params (M)=11*2025.12 | 14.82 | 31.64 | 42.48 | 11.15 | 36.68 | 51.68 | 31.41 | — | — | |
| CMFM-NetVision Backbone=ResNet18, Finetuning Data=RSITMD, Total Params (M)=11*2025.12 | 10.84 | 28.76 | 40.04 | 10 | 32.83 | 47.21 | 28.28 | — | — | |
| AMFMNVision Backbone=ResNet50, Finetuning Data=RSITMD, Total Params (M)=252025.12 | 10.63 | 24.78 | 41.81 | 11.51 | 34.69 | 54.87 | 29.72 | — | — | |
| CLIP (ViT-L)Vision Backbone=ViT-L, Finetuning Data=Zero-shot, Total Params (M)=4282025.12 | 10.18 | 27.66 | 38.5 | 11.46 | 32.52 | 46.99 | 27.88 | — | — | |
| CLIP (ViT-B)Vision Backbone=ViT-B, Finetuning Data=Zero-shot, Total Params (M)=1512025.12 | 9.74 | 22.57 | 34.51 | 8.72 | 27.88 | 42.88 | 24.38 | — | — |