Semantic Segmentation on Mapillary (val)
76.05mIoUCausal-Tune
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Causal-TuneBackbone Category=VFM-based, Training Source Domain=Cityscapes2025.12 | 76.05 | — | — | |
| FADABackbone Category=VFM-based, Training Source Domain=Cityscapes2025.12 | 75.86 | — | — | |
| SETBackbone Category=VFM-based, Training Source Domain=Cityscapes2025.12 | 75.67 | — | — | |
| ReinBackbone Category=VFM-based, Training Source Domain=Cityscapes2025.12 | 74.03 | — | — | |
| CMFormerBackbone Category=Transformer-based, Training Source Domain=Cityscapes2025.12 | 71.1 | — | — | |
| Causal-TuneBackbone Category=VFM-based, Training Source Domain=GTA52025.12 | 68.21 | — | — | |
| FADABackbone Category=VFM-based, Training Source Domain=GTA52025.12 | 68.09 | — | — | |
| SETBackbone Category=VFM-based, Training Source Domain=GTA52025.12 | 67.68 | — | — | |
| CLOUDSEncoder Parameters=198M, DG Category=Vision-Language DG2023.12 | 67 | — | — | |
| HGFormerBackbone Category=Transformer-based, Training Source Domain=Cityscapes2025.12 | 66.9 | — | — | |
| ReinBackbone Category=VFM-based, Training Source Domain=GTA52025.12 | 66.1 | — | — | |
| VLTSegEncoder Parameters=304M, DG Category=Vision-Language DG2023.12 | 66 | — | — | |
| ReinEncoder Parameters=307M, DG Category=Vision-Language DG2023.12 | 64.9 | — | — | |
| DGinStyleEncoder Parameters=81.4M, DG Category=Vision-Language DG2023.12 | 62.5 | — | — | |
| DIDEXEncoder Parameters=81.4M, DG Category=Vision-Language DG2023.12 | 62 | — | — | |
| HRDAEncoder Parameters=81.4M, DG Category=Vision DG2023.12 | 61.2 | — | — | |
| CMFormerEncoder Parameters=197M, DG Category=Vision DG2023.12 | 60.1 | — | — | |
| CMFormerBackbone Category=Transformer-based, Training Source Domain=GTA52025.12 | 60.09 | — | — | |
| Ours (IRW)Backbone=ResNet-50, Output Stride=16, Training Dataset=Cityscapes2021.03 | 59.2 | — | — | |
| Ours (IW)Backbone=ResNet-50, Output Stride=16, Training Dataset=Cityscapes2021.03 | 58.9 | — | — | |
| Ours (ISW)Backbone=ResNet-50, Output Stride=16, Training Dataset=Cityscapes2021.03 | 58.64 | — | — | |
| ISWBackbone Category=Resnet-based, Training Source Domain=Cityscapes2025.12 | 58.64 | — | — | |
| IBAFormerEncoder Parameters=81.4M, DG Category=Vision DG2023.12 | 58.3 | — | — | |
| IBN-NetBackbone=ResNet-50, Output Stride=16, Training Dataset=Cityscapes2021.03 | 57.04 | — | — | |
| IBNBackbone Category=Resnet-based, Training Source Domain=Cityscapes2025.12 | 57.04 | — | — | |
| IterNormBackbone=ResNet-50, Output Stride=16, Training Dataset=Cityscapes2021.03 | 56.26 | — | — | |
| ItenormBackbone Category=Resnet-based, Training Source Domain=Cityscapes2025.12 | 56.26 | — | — | |
| SWBackbone=ResNet-50, Output Stride=16, Training Dataset=Cityscapes2021.03 | 55.82 | — | — | |
| IWBackbone Category=Resnet-based, Training Source Domain=Cityscapes2025.12 | 55.82 | — | — | |
| SHADEEncoder Parameters=81.4M, DG Category=Vision DG2023.12 | 55 | — | — | |
| Soft-labelling for semantic segmentationVenue/Journal=Ours, #GPUs=1, GB/GPU=24, BS=2, Backbone=HRNetV2, Crop size=512 x 10242023.02 | 54.4 | — | — | |
| NeurIPS 2021 [48]Venue/Journal=NeurIPS 2021, #GPUs=8, GB/GPU=32, BS=8, Backbone=HRNetV2, Crop size=512 x 10242023.02 | 53.1 | — | — | |
| ReVTEncoder Parameters=81.4M, DG Category=Vision DG2023.12 | 52.8 | — | — | |
| FAMixBackbone=RN50, Source Dataset=GTAV2023.11 | 52.11 | — | — | |
| FAMixBackbone=RN101, Source Dataset=GTAV2023.11 | 51.97 | — | — | |
| DiGA (Our Distillation)Backbone=ResNet-101, Source Dataset=GTA52023.04 | 51.78 | — | — | |
| BaselineBackbone=ResNet-50, Output Stride=16, Training Dataset=Cityscapes2021.03 | 51.68 | — | — | |
| HRNetV2 [23]Venue/Journal=ECCV 2020, #GPUs=4, GB/GPU=32, BS=8, Backbone=HRNetV2, Crop size=512 x 10242023.02 | 50.8 | — | — | |
| BaselineDG Category=Vision DG2023.12 | 50.1 | — | — | |
| PSPNet2018.03 | 49.76 | — | — | |
| BlindNetBackbone=ShuffleNetV2, External Dataset=false, External Module=true, Source Domain=Cityscapes2024.03 | 49.69 | — | — | |
| TLDREncoder=ResNet-1012023.03 | 48.8 | — | — | |
| TLDRBackbone=RN101, Source Dataset=GTAV, Extra-data usage=true2023.11 | 48.8 | — | — | |
| TLDRTrain on=GTA and SYNTHIA, Backbone=ResNet-502023.03 | 47.8 | — | — | |
| ECCV 2018 [10]Venue/Journal=ECCV 2018, #GPUs=50, GB/GPU=24, BS=32, Backbone=HRNetV2, Crop size=512 x 10242023.02 | 47.7 | — | — | |
| SHADETrain on=GTA and SYNTHIA, Backbone=ResNet-502023.03 | 47.6 | — | — | |
| EMANetInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=ResNet-502022.07 | 47.5 | 4.2 | — | |
| WildNetEncoder=ResNet-1012023.03 | 47.08 | — | — | |
| BlindNetBackbone=ResNet-50, External Dataset=false, External Module=true, Source Domain=GTAV2024.03 | 47.08 | — | — | |
| WildNetBackbone=RN101, Source Dataset=GTAV, Extra-data usage=true2023.11 | 47.08 | — | — | |
| DPCLBackbone=RN50, Source Dataset=GTAV2023.11 | 46.74 | — | — | |
| OCRNetInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=ResNet-502022.07 | 46.6 | 3.8 | — | |
| SFNetInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=ResNet-182022.07 | 46.5 | 19.8 | — | |
| Deeplabv3+Input Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=ResNet-502022.07 | 46.4 | 3.2 | — | |
| SFNet-LiteInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=ResNet-182022.07 | 46.3 | 24.5 | — | |
| TLDREncoder=ResNet-502023.03 | 46.18 | — | — | |
| TLDRBackbone=RN50, Source Dataset=GTAV, Extra-data usage=true2023.11 | 46.18 | — | — | |
| WildNetEncoder=ResNet-502023.03 | 46.09 | — | — | |
| WildNetBackbone=RN50, Source Dataset=GTAV, Extra-data usage=true2023.11 | 46.09 | — | — | |
| SFNet-LiteInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=STDC-22022.07 | 45.8 | 35.8 | — | |
| IJCV 2023 [52]Venue/Journal=IJCV 2023, #GPUs=8, GB/GPU=11, BS=16, Backbone=HRNetV2, Crop size=512 x 10242023.02 | 45.8 | — | — | |
| SFNetInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=DF22022.07 | 45.6 | 57.8 | — | |
| SPC-NetBackbone=RN50, Source Dataset=GTAV2023.11 | 45.51 | — | — | |
| SHADEBackbone=ResNet-101, Source Dataset=GTA52023.04 | 45.5 | — | — | |
| SHADEEncoder=ResNet-1012023.03 | 45.5 | — | — | |
| SHADEBackbone=RN101, Source Dataset=GTAV, Full-data training=true2023.11 | 45.5 | — | — | |
| DSSPNBackbone=ResNet-101, Training Strategy=Universal2018.03 | 45.01 | — | — | |
| STDC2Input Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX2022.07 | 43.5 | 29 | — | |
| FSDREncoder=ResNet-1012023.03 | 43.4 | — | — | |
| SHADEEncoder=ResNet-502023.03 | 43.34 | — | — | |
| SHADEBackbone=RN50, Source Dataset=GTAV2023.11 | 43.34 | — | — | |
| BiSeNet-V1Input Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=ResNet-182022.07 | 43.2 | 24.3 | — | |
| BaselineBackbone=ShuffleNetV2, External Dataset=false, External Module=false, Source Domain=Cityscapes2024.03 | 43.13 | — | — | |
| DANetInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=ResNet-502022.07 | 42.9 | 2 | — | |
| ICNetInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX2022.07 | 42.8 | 48.2 | — | |
| IBN-Net + AdvStyleBackbone=ResNet-101, Source Domain=GTAV2022.07 | 42.67 | — | — | |
| DSSPNBackbone=ResNet-101, Training Strategy=finetune2018.03 | 42.57 | — | — | |
| PSPNetInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=ResNet-502022.07 | 42.4 | 4.8 | — | |
| DSSPNBackbone=ResNet-1012018.03 | 42.39 | — | — | |
| ISW + AdvStyleBackbone=ResNet-101, Source Domain=GTAV2022.07 | 41.96 | — | — | |
| STDC1Input Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX2022.07 | 41.9 | 34.5 | — | |
| ISW + AdvStyleBackbone=ResNet-50, Source Domain=GTAV2022.07 | 41.89 | — | — | |
| SAN-SAWEncoder=ResNet-502023.03 | 41.86 | — | — | |
| SAN & SAWBackbone=RN50, Source Dataset=GTAV2023.11 | 41.86 | — | — | |
| Ours-CBackbone=ResNet-50, Architecture=DeepLabV3+, Output Stride=16, Training Dataset=GTAV2023.04 | 41.63 | — | — | |
| DIRLBackbone Category=Resnet-based, Training Source Domain=GTA52025.12 | 41.6 | — | — | |
| SFNetInput Size=1536x1536, Inference Scale=single-scale, Hardware=TITAN-RTX, Backbone=DF12022.07 | 41.4 | 102.2 | — | |
| Ours-BBackbone=ResNet-50, Architecture=DeepLabV3+, Output Stride=16, Training Dataset=GTAV2023.04 | 41.31 | — | — | |
| Wider Network2018.03 | 41.12 | — | — | |
| IBN-Net + AdvStyleBackbone=ResNet-50, Source Domain=GTAV2022.07 | 40.82 | — | — | |
| SAN-SAWBackbone=ResNet-101, Source Dataset=GTA52023.04 | 40.77 | — | — | |
| SAN-SAWEncoder=ResNet-1012023.03 | 40.77 | — | — | |
| SAN & SAWBackbone=RN101, Source Dataset=GTAV2023.11 | 40.77 | — | — | |
| Ours-DBackbone=ResNet-50, Architecture=DeepLabV3+, Output Stride=16, Training Dataset=GTAV2023.04 | 40.76 | — | — | |
| SiamDoGeEncoder=ResNet-502023.03 | 40.64 | — | — | |
| SiamDoGeBackbone=RN50, Source Dataset=GTAV2023.11 | 40.64 | — | — | |
| ISWBackbone=ResNet-50, Training Set=GTAV2021.03 | 40.33 | — | — | |
| Ours (ISW)Backbone=ResNet-50, Output stride=16, Training Dataset=GTAV2021.03 | 40.33 | — | — | |
| ISWBackbone=ResNet-50, Source Domain=GTAV2022.07 | 40.33 | — | — | |
| RobustNet [4]Backbone=ResNet-50, Architecture=DeepLabV3+, Output Stride=16, Training Dataset=GTAV2023.04 | 40.33 | — | — |