Semantic Segmentation on UAVid
59.7mIoUOracle
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OracleTraining Regime=Oracle (fully supervised SegFormer-b0)2025.12 | 59.7 | — | |
| SegEarth-OV3Training Regime=Training-free2025.12 | 54.7 | — | |
| ConInfer2026.03 | 46.4 | — | |
| SegEarth-OV2026.03 | 42.81 | — | |
| SegEarth-OVVenue=Ours2024.10 | 42.5 | — | |
| SegEarth-OVTraining Regime=Training-free2025.12 | 42.5 | — | |
| ProxyCLIP + GLA2026.03 | 41.9 | — | |
| GLA-CLIP2026.03 | 41.9 | — | |
| ProxyCLIP2026.03 | 41.4 | — | |
| CorrCLIPTraining Regime=Training-free2025.12 | 38.3 | — | |
| MaskCLIP*type=baseline2026.03 | 37.2 | — | |
| ClearCLIPVenue=ECCV'242024.10 | 36.2 | — | |
| ClearCLIPTraining Regime=Training-free2025.12 | 36.2 | — | |
| ClearCLIP2026.03 | 36.2 | — | |
| ProxyCLIPTraining Regime=Training-free2025.12 | 35.8 | — | |
| Pi-SegBackbone=ViT-B, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 34.45 | 50.94 | |
| ClearCLIP2026.03 | 34.35 | — | |
| Pi-SegBackbone=ViT-L, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 33.58 | 48.78 | |
| GEM2026.03 | 33.49 | — | |
| GEMVenue=CVPR 242024.10 | 33.4 | — | |
| GEMTraining Regime=Training-free2025.12 | 33.4 | — | |
| CLIP-DINOiser2026.03 | 33.3 | — | |
| SCLIPVenue=arXiv'232024.10 | 31.4 | — | |
| SCLIPTraining Regime=Training-free2025.12 | 31.4 | — | |
| MaskCLIP2026.03 | 30.09 | — | |
| SCLIP2026.03 | 29.69 | — | |
| MaskCLIPVenue=ECCV'222024.10 | 28.6 | — | |
| MaskCLIPTraining Regime=Training-free2025.12 | 28.6 | — | |
| DR-SegBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 28.45 | 43.23 | |
| RSKT-SegBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 28.14 | 42.86 | |
| DR-SegBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 27.78 | 42.53 | |
| Cat-SegBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 25.73 | 40.54 | |
| Cat-SegTraining Regime=Training on remote sensing segmentation data2025.12 | 25.7 | — | |
| RSKT-SegTraining Regime=Training on remote sensing segmentation data2025.12 | 25.7 | — | |
| GSNetBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 25.42 | 40.7 | |
| OVRSBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 25.23 | 40.18 | |
| Cat-SegBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 24.56 | 39.2 | |
| GSNetBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 24.22 | 35.03 | |
| GSNetTraining Regime=Training on remote sensing segmentation data2025.12 | 24.2 | — | |
| OVRSBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 24.13 | 34.83 | |
| OVRSTraining Regime=Training on remote sensing segmentation data2025.12 | 24.1 | — | |
| RSKT-SegBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 23.88 | 38.75 | |
| SANBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 23.53 | 38.14 | |
| SANTraining Regime=Training on remote sensing segmentation data2025.12 | 23.5 | — | |
| SANBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 22.34 | 37.56 | |
| SEDBackbone=ConvNeXt-L, Training Dataset=DLRSD2026.04 | 21.33 | 35.64 | |
| SEDTraining Regime=Training on remote sensing segmentation data2025.12 | 21.3 | — | |
| SCANTraining Regime=Training on remote sensing segmentation data2025.12 | 20.3 | — | |
| SCANBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 20.28 | 34.43 | |
| SEDBackbone=ConvNeXt-B, Training Dataset=DLRSD2026.04 | 20.12 | 33.34 | |
| DR-SegBackbone=ViT-L, Training Dataset=iSAID2026.04 | 18.9 | 36.98 | |
| DR-SegBackbone=ViT-B, Training Dataset=iSAID2026.04 | 18.73 | 36.46 | |
| SCANBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 18.56 | 30.31 | |
| RSKT-SegBackbone=ViT-L, Training Dataset=iSAID2026.04 | 17.36 | 35.75 | |
| RSKT-SegBackbone=ViT-B, Training Dataset=iSAID2026.04 | 17.15 | 34.78 | |
| OVRSBackbone=ViT-L, Training Dataset=iSAID2026.04 | 16.24 | 27 | |
| OVRSBackbone=ViT-B, Training Dataset=iSAID2026.04 | 16.22 | 24.05 | |
| Cat-SegBackbone=ViT-L, Training Dataset=iSAID2026.04 | 16.1 | 26.9 | |
| GSNetBackbone=ViT-L, Training Dataset=iSAID2026.04 | 15.98 | 27.1 | |
| GSNetBackbone=ViT-B, Training Dataset=iSAID2026.04 | 15.93 | 24.33 | |
| Cat-SegBackbone=ViT-B, Training Dataset=iSAID2026.04 | 15.47 | 23.57 | |
| SEDBackbone=ConvNeXt-L, Training Dataset=iSAID2026.04 | 15.21 | 26.8 | |
| SANBackbone=ViT-L, Training Dataset=iSAID2026.04 | 15.01 | 26.5 | |
| SEDBackbone=ConvNeXt-B, Training Dataset=iSAID2026.04 | 14.8 | 18.9 | |
| SCANBackbone=ViT-L, Training Dataset=iSAID2026.04 | 14.32 | 26 | |
| SANBackbone=ViT-B, Training Dataset=iSAID2026.04 | 12.32 | 18.32 | |
| CLIPVenue=ICML 212024.10 | 10.9 | — | |
| CLIPTraining Regime=Training-free2025.12 | 10.9 | — | |
| SCANBackbone=ViT-B, Training Dataset=iSAID2026.04 | 9.87 | 15.3 | |
| CLIP2026.03 | 8.94 | — |