Semantic Segmentation on Cityscapes (val) (mIoU only)
87mIoUHMS + InverseForm
Evaluation Results
| Method | Links | |
|---|---|---|
| HMS + InverseFormBackbone=HRNet48, Fine annotations (F)=true, Coarse annotations (C)=false2021.04 | 87 | |
| HMSBackbone=HRNet48, Fine annotations (F)=true, Coarse annotations (C)=false2021.04 | 86.7 | |
| UniMatch V2Labeled Data (# Img)=3K, Unlabeled Data (# Img)=20K (Cityscapes Extra)2024.10 | 85.5 | |
| Supervised BaselineLabeled Data (# Img)=3K, Unlabeled Data (# Img)=02024.10 | 85.2 | |
| VOLO-D4Backbone=VOLO, Pretrained=ImageNet-1k, multi-scale=true2021.06 | 84.3 | |
| Mask2FormerBackbone=Swin-L, VRAM=> 32GB2026.04 | 84.3 | |
| SegMan-LZero-Shot Transfer=false2026.04 | 84.2 | |
| SegFormerBackbone=MiT-B5, VRAM=> 32GB2026.04 | 84.2 | |
| GSCNN + InverseFormBackbone=WRN38, Fine annotations (F)=true, Coarse annotations (C)=true2021.04 | 84 | |
| SegFormer-B5Backbone=SegFormer, Pretrained=ImageNet-1k, multi-scale=true2021.06 | 84 | |
| GMMSegBackbone=SwinLarge, Base Architecture=Mask2Former2022.10 | 83.8 | |
| SegMAN-BBackbone=SegMAN Encoder-B, Setting=SS2026.06 | 83.8 | |
| PatchDiverseBackbone=Swin-L, Pretrained=ImageNet-22k, multi-scale=true2021.06 | 83.6 | |
| Mask2FormerBackbone=SwinLarge2022.10 | 83.3 | |
| Reload-MambaBackbone=ConvNeXt-Tiny + multi-scale decoder, Setting=SS, val2026.06 | 83.2 | |
| VOLO-D1Backbone=VOLO, Pretrained=ImageNet-1k, multi-scale=true2021.06 | 83.1 | |
| SpineNet-S143+Backbone=SpineNet, Pretrained=ImageNet-1k, multi-scale=true2021.06 | 83 | |
| Ours-D3S2Backbone=ViT-B/16, Mode=Hybrid2026.05 | 82.8 | |
| GSCNN + InverseFormBackbone=WRN38, Fine annotations (F)=true, Coarse annotations (C)=false2021.04 | 82.6 | |
| GMMSegBackbone=MiT-B5, Base Model=SegFormer2022.10 | 82.6 | |
| SegNeXt-BBackbone=MSCAN-B, Setting=SS2026.06 | 82.6 | |
| AlignSegBackbone=ResNet-101, Setting=val2026.06 | 82.4 | |
| DGM-NetBackbone=ResNet-101, Params=53.00, GFLOPs=224.1, Testing Mode=MST+FF2026.04 | 82.3 | |
| SETRBackbone=ViT-L, Pretrained=ImageNet-22k, multi-scale=true2021.06 | 82.1 | |
| Swin-SBackbone=Swin-Small, VRAM=> 32GB2026.04 | 82.1 | |
| AugSegLabeled Data Ratio=FS, Backbone=ResNet-1012026.04 | 82.07 | |
| SegFormerBackbone=MiT-B52022.10 | 82 | |
| AELNumber of coarse images=50002021.10 | 81.95 | |
| Strip PoolingBackbone=ResNet-101, Pretrained=ImageNet-1k, multi-scale=true2021.06 | 81.9 | |
| GMMSegBackbone=Swin-Base, Base Model=UPerNet2022.10 | 81.8 | |
| OCRNetBackbone=ResNet-101, Params=70.41, GFLOPs=325.0, Testing Mode=SS (Single-scale)2026.04 | 81.8 | |
| OCRNetBackbone=ResNet-101, Setting=val2026.06 | 81.8 | |
| DGM-NetBackbone=ResNet-101, VRAM=16GB2026.04 | 81.6 | |
| GSCNN+SegFixBackbone=WRN38, Fine annotations (F)=true, Coarse annotations (C)=false2021.04 | 81.5 | |
| DANetBackbone=ResNet-101, Pretrained=ImageNet-1k, multi-scale=true2021.06 | 81.5 | |
| DANetBackbone=ResNet-101, Params=66.47, GFLOPs=289.0, Testing Mode=MST+FF2026.04 | 81.5 | |
| ESLLabeled Data Ratio=FS, Backbone=ResNet-1012026.04 | 81.44 | |
| CCNetBackbone=ResNet-101, Params=66.13, GFLOPs=276.0, Testing Mode=MST+FF2026.04 | 81.4 | |
| AELNumber of coarse images=30002021.10 | 81.36 | |
| WeatherSegLabeled Data Ratio=FS, Backbone=ResNet-1012026.04 | 81.32 | |
| CCNetBackbone=ResNet-101, Pretrained=ImageNet-1k, multi-scale=true2021.06 | 81.3 | |
| ProtoSegBackbone=MiT-B4, # Param (M)=642022.03 | 81.3 | |
| ANNNetBackbone=ResNet-101, Params=62.86, GFLOPs=348.0, Testing Mode=MST+FF2026.04 | 81.3 | |
| SegNeXt-SBackbone=MSCAN-S, Setting=SS2026.06 | 81.3 | |
| CCNetBackbone=ResNet-101, Setting=val2026.06 | 81.3 | |
| OCRNetBackbone=D3Net-L, #param.=42.3M, Test-time augmentation=false2020.11 | 81.2 | |
| GMMSegBackbone=HRNetv2-W48, Base Model=OCRNet2022.10 | 81.2 | |
| DINOv3Backbone=ViT-B/16, Mode=FT2026.05 | 81.2 | |
| UniMatchLabeled Data Ratio=FS, Backbone=ResNet-1012026.04 | 81.15 | |
| OCRBackbone=HRNetV2-W48, # Param (M)=70.32022.03 | 81.1 | |
| ProtoSegBackbone=HRNetV2-W48, # Param (M)=65.82022.03 | 81.1 | |
| GMMSegBackbone=ResNet101, Base Model=DeepLabv3+2022.10 | 81.1 | |
| UPerNetBackbone=Swin-Base2022.10 | 81.1 | |
| SegFormerBackbone=MiT-B2, VRAM=> 32GB2026.04 | 81.1 | |
| GSCNNBackbone=WRN38, Fine annotations (F)=true, Coarse annotations (C)=false2021.04 | 81 | |
| SegFormer-B2Backbone=MiT-B2, Setting=SS2026.06 | 81 | |
| AELLabeled Data Ratio=FS, Backbone=ResNet-1012026.04 | 80.95 | |
| BaselineNumber of coarse images=50002021.10 | 80.92 | |
| DeepLabV3+Backbone=ResNet-101, # Param (M)=62.72022.03 | 80.9 | |
| DPCBackbone=Xception-71, Pretrained=ImageNet-1k, multi-scale=true2021.06 | 80.8 | |
| GSCNNBackbone=WideResNet-38, Params=129.17, Testing Mode=SS (Single-scale)2026.04 | 80.8 | |
| DGM-NetBackbone=ResNet-101, Params=53.00, GFLOPs=224.1, Testing Mode=SS (Single-scale)2026.04 | 80.8 | |
| CA-LoRAFraction of the Cityscapes Dataset=100%2025.03 | 80.74 | |
| OCRNetBackbone=HRNetV2-W48, #param.=70.3M, Test-time augmentation=false2020.11 | 80.7 | |
| SegFormerBackbone=MiT-B4, # Param (M)=64.12022.03 | 80.7 | |
| FCNBackbone=D3Net-L, #param.=38.7M, Test-time augmentation=false2020.11 | 80.6 | |
| DenseASPPBackbone=DenseNet, Pretrained=ImageNet-1k, multi-scale=true2021.06 | 80.6 | |
| ProtoSegBackbone=Swin-Base, # Param (M)=90.52022.03 | 80.6 | |
| DeepLabv3+Backbone=ResNet1012022.10 | 80.6 | |
| VimBackbone=Vim-L, VRAM=> 32GB2026.04 | 80.6 | |
| BaselineNumber of coarse images=30002021.10 | 80.55 | |
| CCNetBackbone=ResNet-101, Params=66.13, GFLOPs=276.0, Testing Mode=SS (Single-scale)2026.04 | 80.5 | |
| ANNNetBackbone=ResNet-101, Params=62.86, GFLOPs=348.0, Testing Mode=SS (Single-scale)2026.04 | 80.5 | |
| DNLBackbone=ResNet-101, Params=71.49, GFLOPs=343.0, Testing Mode=SS (Single-scale)2026.04 | 80.5 | |
| Swin-B (IN21K)Backbone=Swin-B, Mode=FT2026.05 | 80.5 | |
| CCNetBackbone=ResNet-101, Head Design=Criss-Cross Attention, Adaptive Fusion=Yes2026.05 | 80.5 | |
| FoR-NetBackbone=ResNet-101, Head Design=Selector + Top-K Multi-Scale Head, Adaptive Fusion=Top-K selective2026.05 | 80.5 | |
| FoR-NetBackbone=ResNet-1012026.05 | 80.49 | |
| ESLLabeled Data Ratio=1/2, Backbone=ResNet-1012026.04 | 80.46 | |
| DatasetDMFraction of the Cityscapes Dataset=100%2025.03 | 80.45 | |
| AugSegLabeled Data Ratio=1/2, Backbone=ResNet-1012026.04 | 80.43 | |
| HRNetBackbone=HRNetV2-W48, # Param (M)=65.92022.03 | 80.4 | |
| OCRNetBackbone=HRNetv2-W482022.10 | 80.4 | |
| ATV-NetBackbone=ResNet-101, Head Design=Triple-View Head, Adaptive Fusion=Yes2026.05 | 80.31 | |
| Auto-DeepLab-L#param.=44.4M, Test-time augmentation=false, Reported in reference paper=true2020.11 | 80.3 | |
| MaskFormerBackbone=ResNet-101, # Param (M)=602022.03 | 80.3 | |
| OneFormerSupervision regime=Supervised, Notes=Fully supervised on each dataset2026.04 | 80.3 | |
| SegMAN-TBackbone=SegMAN Encoder-T, Setting=SS2026.06 | 80.3 | |
| AELBackbone=DeepLabv3+ (ResNet-101), Partition Protocol=1/2, Labeled Samples=14882021.10 | 80.28 | |
| AELNumber of coarse images=10002021.10 | 80.28 | |
| AELLabeled Data Ratio=1/2, Backbone=ResNet-1012026.04 | 80.28 | |
| WeatherSegLabeled Data Ratio=1/2, Backbone=ResNet-1012026.04 | 80.23 | |
| BaselineNumber of coarse images=10002021.10 | 80.22 | |
| DeepLabV3Backbone=D-ResNet-101, #param.=87.1M, Test-time augmentation=false2020.11 | 80.2 | |
| OSMBackbone=ConvNeXt-L, Mode=FZ2026.05 | 80.2 | |
| BaselineNumber of coarse images=02021.10 | 80.16 | |
| StrictLabeled Data Ratio=FS, Backbone=ResNet-1012026.04 | 79.99 | |
| DANetBackbone=ResNet-101, Head Design=Dual Attention, Adaptive Fusion=Yes2026.05 | 79.93 | |
| FCNBackbone=HRNetV2-W48, #param.=65.9M, Test-time augmentation=false2020.11 | 79.9 | |
| DANetBackbone=ResNet-101, Augmentation=Stronger, #params(M)=71.29, FLOPs(G)=709.18, Pixel-wise logit generation=Directly utilize the context head features without concatenating the 2048-dim c5 features2020.12 | 79.88 |