Semantic Segmentation on iSAID
94.86mIoUOVRS
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| OVRSBackbone=ViT-L, Training Dataset=iSAID2026.04 | 94.86 | 97.06 | — | — | |
| Cat-SegBackbone=ViT-L, Training Dataset=iSAID2026.04 | 94.77 | 96.96 | — | — | |
| DR-SegBackbone=ViT-L, Training Dataset=iSAID2026.04 | 94.61 | 97.02 | — | — | |
| OVRSBackbone=ViT-B, Training Dataset=iSAID2026.04 | 94.6 | 96.87 | — | — | |
| SEDBackbone=ConvNeXt-L, Training Dataset=iSAID2026.04 | 94.32 | 96.84 | — | — | |
| Cat-SegBackbone=ViT-B, Training Dataset=iSAID2026.04 | 94.16 | 96.72 | — | — | |
| RSKT-SegBackbone=ViT-L, Training Dataset=iSAID2026.04 | 93.96 | 96.63 | — | — | |
| SEDBackbone=ConvNeXt-B, Training Dataset=iSAID2026.04 | 93.31 | 96.66 | — | — | |
| RSKT-SegBackbone=ViT-B, Training Dataset=iSAID2026.04 | 93.16 | 96.37 | — | — | |
| GSNetBackbone=ViT-L, Training Dataset=iSAID2026.04 | 93.11 | 95.98 | — | — | |
| DR-SegBackbone=ViT-B, Training Dataset=iSAID2026.04 | 92.17 | 95.56 | — | — | |
| GSNetBackbone=ViT-B, Training Dataset=iSAID2026.04 | 90 | 93.6 | — | — | |
| SANBackbone=ViT-L, Training Dataset=iSAID2026.04 | 87.22 | 92.54 | — | — | |
| SANBackbone=ViT-B, Training Dataset=iSAID2026.04 | 85.43 | 90.36 | — | — | |
| SkySense2023.12 | 70.91 | — | — | — | |
| SkySensePublication=CVPR’242026.04 | 70.91 | — | — | — | |
| RS-vHeatPublication=ICCV’252026.04 | 68.72 | — | — | — | |
| GFMPublication=ICCV'232023.12 | 68.71 | — | — | — | |
| UperNetPretrain=RingMo [32], Backbone=Swin-B2022.08 | 67.2 | — | — | — | |
| RingMoPublication=TGRS'222023.12 | 67.2 | — | — | — | |
| RemoteAgentPublication=-2026.04 | 67.01 | — | — | — | |
| SAMRS+Publication=NIPS'232023.12 | 66.26 | — | — | — | |
| TOYPublication=JSTARS'232023.12 | 66.24 | — | — | — | |
| CMIDPublication=CVPR'232023.12 | 66.21 | — | — | — | |
| GASSLPublication=ICCV'212023.12 | 65.95 | — | — | — | |
| Scale-MAEPublication=ICCV'232023.12 | 65.77 | — | — | — | |
| Scale-MAEPublication=ICCV’232026.04 | 65.77 | — | — | — | |
| FactSegPretrain=IMP, Backbone=ResNet-502022.08 | 64.8 | — | — | — | |
| RemoteSAMPublication=MM’252026.04 | 64.72 | — | — | — | |
| UperNetPretrain=IMP, Backbone=Swin-T2022.08 | 64.6 | — | — | — | |
| UperNetPretrain=MAE, Backbone=VITAE-B + RVSA*2022.08 | 64.49 | — | — | — | |
| RVSAPublication=TGRS'222023.12 | 64.49 | — | — | — | |
| CACOPublication=CVPR'232023.12 | 64.32 | — | — | — | |
| UperNetPretrain=RSP, Backbone=VITAEv2-S2022.08 | 64.3 | — | — | — | |
| SCANBackbone=ViT-L, Training Dataset=iSAID2026.04 | 64.28 | 85.46 | — | — | |
| MA3EPublication=ECCV’242026.04 | 64.06 | — | — | — | |
| SSL4EOPublication=GRSM'232023.12 | 64.01 | — | — | — | |
| UperNetPretrain=MAE, Backbone=VITAE-B + VSA2022.08 | 63.92 | — | — | — | |
| UperNetPretrain=MAE, Backbone=VIT-B + RVSA*2022.08 | 63.85 | — | — | — | |
| UperNetPretrain=MAE, Backbone=ViT-B + RVSA2022.08 | 63.76 | — | — | — | |
| FarSegPretrain=IMP, Backbone=ResNet-502022.08 | 63.7 | — | — | — | |
| UperNetPretrain=MAE, Backbone=ViT-B + VSA2022.08 | 63.55 | — | — | — | |
| UperNetPretrain=MAE, Backbone=VITAE-B + RVSA2022.08 | 63.48 | — | — | — | |
| SatMAEPublication=NIPS'222023.12 | 62.97 | — | — | — | |
| SCANBackbone=ViT-B, Training Dataset=iSAID2026.04 | 62.34 | 76.48 | — | — | |
| UperNetPretrain=IMP, Backbone=ResNet-502022.08 | 61.9 | — | — | — | |
| UperNetPretrain=MAE, Backbone=VITAE-B2022.08 | 61.77 | — | — | — | |
| UperNetPretrain=MAE, Backbone=ViT-B2022.08 | 61.4 | — | — | — | |
| DeeplabV3+Pretrain=IMP, Backbone=ResNet-502022.08 | 60.8 | — | — | — | |
| PSPNetPretrain=IMP, Backbone=ResNet-502022.08 | 60.3 | — | — | — | |
| Semantic FPNPretrain=IMP, Backbone=ResNet-502022.08 | 59.3 | — | — | — | |
| DR-SegBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 57.56 | 73.92 | — | — | |
| DANetPretrain=IMP, Backbone=ResNet-502022.08 | 57.5 | — | — | — | |
| SeCoPublication=ICCV'212023.12 | 57.2 | — | — | — | |
| INSID3Encoder=DINOv3, #Param=304 M, Training Protocol=Training free: Unsupervised pre-training, Shot count=52026.03 | 56.9 | — | — | — | |
| RSKT-SegBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 56.88 | 74.48 | — | — | |
| RSKT-SegBackbone=ViT-L, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 54.32 | 71.72 | — | — | |
| RSKT-SegTraining Regime=Training on remote sensing segmentation data2025.12 | 54.3 | — | — | — | |
| GF-SAM† + our debiasEncoder=DINOv3 + SAM, #Param=945 M, Training Protocol=Training free: Mask-supervised pre-training, Shot count=52026.03 | 54.1 | — | — | — | |
| GSNetBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 53.73 | 71.57 | — | — | |
| GSNetBackbone=ViT-L, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 53.73 | 71.57 | — | — | |
| GSNetTraining Regime=Training on remote sensing segmentation data2025.12 | 53.7 | — | — | — | |
| Pi-SegBackbone=ViT-L, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 53.5 | 69.68 | — | — | |
| Cat-SegBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 53.34 | 70.86 | — | — | |
| Cat-SegBackbone=ViT-L, Type=OVS, Training Dataset=DLRSD2026.04 | 53.34 | 70.86 | — | — | |
| Cat-SegTraining Regime=Training on remote sensing segmentation data2025.12 | 53.3 | — | — | — | |
| GF-SAM†Encoder=DINOv3 + SAM, #Param=945 M, Training Protocol=Training free: Mask-supervised pre-training, Shot count=52026.03 | 53.2 | — | — | — | |
| OVRSTraining Regime=Training on remote sensing segmentation data2025.12 | 52.7 | — | — | — | |
| OVRSBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 52.65 | 69.59 | — | — | |
| OVRSBackbone=ViT-L, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 52.65 | 69.59 | — | — | |
| UNetFormerPretrain=IMP, Backbone=ResNet-182022.08 | 52.4 | — | — | — | |
| GF-SAMEncoder=DINOv2 + SAM, #Param=945 M, Training Protocol=Training free: Mask-supervised pre-training, Shot count=52026.03 | 52.4 | — | — | — | |
| SEDBackbone=ConvNeXt-L, Training Dataset=DLRSD2026.04 | 51.23 | 68.24 | — | — | |
| SEDBackbone=ConvNeXt-L, Type=OVS, Training Dataset=DLRSD2026.04 | 51.23 | 68.24 | — | — | |
| SEDTraining Regime=Training on remote sensing segmentation data2025.12 | 51.2 | — | — | — | |
| SANTraining Regime=Training on remote sensing segmentation data2025.12 | 49.6 | — | — | — | |
| SANBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 49.56 | 67.25 | — | — | |
| SANBackbone=ViT-L, Type=OVS, Training Dataset=DLRSD2026.04 | 49.56 | 67.25 | — | — | |
| DiffewSEncoder=Stable Diffusion, #Param=890 M, Training Protocol=Task-specific fine-tuning: Semantic + mask supervision, Shot count=52026.03 | 48 | — | — | — | |
| SDCI-v2Prompt Setting=Original Labels, GFLOPs=1683.29, Structural Branch=DINO-v2 (ViT-B/14)2026.01 | 46.37 | — | — | — | |
| SDCI-v1Prompt Setting=Original Labels, GFLOPs=2022.72, Structural Branch=DINO-v1 (ViT-B/8)2026.01 | 45.67 | — | — | — | |
| SCANTraining Regime=Training on remote sensing segmentation data2025.12 | 44.3 | — | — | — | |
| SCANBackbone=ViT-L, Training Dataset=DLRSD2026.04 | 44.28 | 67.25 | — | — | |
| SCANBackbone=ViT-L, Type=OVS, Training Dataset=DLRSD2026.04 | 44.28 | 67.25 | — | — | |
| RSKT-SegBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 44.04 | 61.23 | — | — | |
| RSKT-SegBackbone=ViT-B, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 44.04 | 61.23 | — | — | |
| SkySense-OTraining Regime=Training on remote sensing segmentation data2025.12 | 43.9 | — | — | — | |
| ResCLIPPrompt Setting=Original Labels, GFLOPs=1029.662026.01 | 43.79 | — | — | — | |
| GSNetBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 42 | 59.19 | — | — | |
| GSNetBackbone=ViT-B, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 42 | 59.19 | — | — | |
| FCNPretrain=IMP, Backbone=VGG-162022.08 | 41.7 | — | — | — | |
| Pi-SegBackbone=ViT-B, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 40.7 | 56.53 | — | — | |
| SINEEncoder=DINOv2, #Param=373 M, Training Protocol=Task-specific fine-tuning: Semantic + mask supervision, Shot count=52026.03 | 40.5 | — | — | — | |
| CASSPrompt Setting=Original Labels, GFLOPs=26943.792026.01 | 40.41 | — | — | — | |
| DR-SegBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 39.65 | 56.18 | — | — | |
| OVRSBackbone=ViT-B, Training Dataset=DLRSD2026.04 | 39.09 | 54.43 | — | — | |
| OVRSBackbone=ViT-B, Type=OVRSIS, Training Dataset=DLRSD2026.04 | 39.09 | 54.43 | — | — | |
| OracleTraining Regime=Oracle (fully supervised SegFormer-b0)2025.12 | 36.2 | — | — | — | |
| SegGPTEncoder=ViT, #Param=354 M, Training Protocol=Task-specific fine-tuning: Semantic + mask supervision, Shot count=52026.03 | 35.9 | — | — | — | |
| MatcherEncoder=DINOv2 + SAM, #Param=945 M, Training Protocol=Training free: Mask-supervised pre-training, Shot count=52026.03 | 34.3 | — | — | — |