Semantic Segmentation on Cityscapes (val) (mIoU)
87.1mIoUHMS + DejaVu
Evaluation Results
| Method | Links | |
|---|---|---|
| HMS + DejaVuBackbone=HRNet48, GMacs=8932023.03 | 87.1 | |
| OursHead=Upernet [42], Training data=Mapi+City, Params=912M2023.12 | 87.1 | |
| InternImage-HBackbone=InternImage-H2022.11 | 87 | |
| InternImage-HHead=Mask2Former [5], Training data=Mapi+City, Params=1.2B2023.12 | 87 | |
| PSA2022.11 | 86.9 | |
| HRNet-OCR(PSA)Head=OCRHead [48], Training data=Mapi+City2023.12 | 86.9 | |
| HMSBackbone=HRNet48, GMacs=8932023.03 | 86.7 | |
| OCR + DejaVuBackbone=HRNet48, GMacs=3482023.03 | 86.5 | |
| InternImage-XLHead=Upernet [42], Training data=Mapi+City, Params=368M2023.12 | 86.4 | |
| HRNet-OCR(MA)Head=OCRHead [48], Training data=Mapi+City2023.12 | 86.3 | |
| OCRBackbone=HRNet48, GMacs=3482023.03 | 86.1 | |
| OneFormerHead=Transformer decoder [15], Training data=Mapi+City, Params=372M2023.12 | 85.8 | |
| ViT-Adapte-LHead=Mask2Former [5], Training data=Mapi+City, Params=571M2023.12 | 85.8 | |
| OursHead=Upernet [42], Training data=City, Params=912M2023.12 | 85.7 | |
| HRNet + DejaVuBackbone=HRNet48, GMacs=1752023.03 | 85.4 | |
| SeMaskHead=Mask2Former [5], Training data=City, Params=222M2023.12 | 85 | |
| ViT AdapterBackbone=ViT, GMacs=10892023.03 | 84.9 | |
| HRNetBackbone=HRNet48, GMacs=1752023.03 | 84.7 | |
| OneFormerHead=Transformer decoder [15], Training data=City, Params=372M2023.12 | 84.6 | |
| OpenSeeD (L)Type=Open-vocabulary, Backbone=Large2023.03 | 84.5 | |
| Mask2FormerHead=Mask2Former [5], Training data=City2023.12 | 84.3 | |
| SegformerBackbone=MiT-B5, GMacs=3622023.03 | 84 | |
| SeMaskBackbone=Swin-L, GMacs=2582023.03 | 84 | |
| SegFormerHead=SegFormer [43], Training data=Mapi+City, Params=85M2023.12 | 84 | |
| DDPHead=DeformableHead [17], Training data=City, Params=209M2023.12 | 83.9 | |
| Image Resynthesis++Retrain=false2021.03 | 83.5 | |
| OursRetrain=false2021.03 | 83.5 | |
| Mask2FormerBackbone=Swin-L, GMacs=2512023.03 | 83.3 | |
| HRFormer-B + OCR + SegFix#params.=56.2M, FLOPs=1119.9G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 83.2 | |
| OneFormer (L)Type=Closed-set, Backbone=Large2023.03 | 83 | |
| Mask2Former (L)Type=Closed-set, Backbone=Large2023.03 | 82.9 | |
| DDPSHead=SegFormer [43], Training data=City, Params=123M2023.12 | 82.9 | |
| DeeplabV3Backbone=ResNeSt-2002020.04 | 82.7 | |
| Mask2Former (B)Type=Closed-set, Backbone=Base2023.03 | 82.7 | |
| WaveMixPre-train=ImageNet-1k, Parameters=63 M, Evaluation=Single-scale2022.05 | 82.7 | |
| HRFormer-B + OCR#params.=56.2M, FLOPs=1119.9G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 82.6 | |
| SegFormer-B5Encoder Size=81.4M2022.04 | 82.4 | |
| Previous SOTA [1]Pre-train=ImageNet-1k, Parameters=85 M, Evaluation=Single-scale2022.05 | 82.4 | |
| FAN-L-HybridEncoder Size=76.8M2022.04 | 82.3 | |
| SETR-PUP#params.=317.8M, FLOPs=2326.7G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 82.2 | |
| FAN-B-HybridEncoder Size=50.4M2022.04 | 82.2 | |
| SETRHead=SETRUPHead [51], Training data=City, Params=318M2023.12 | 82.2 | |
| SETR-PUPBackbone=T-Large, Training schedule=80k, Inference scale=Multi-scale (MS)2020.12 | 82.15 | |
| CleanBackbone=Swin-T2024.10 | 82.1 | |
| DANetBackbone=ResNet-1012021.05 | 82 | |
| OCR + DejaVuBackbone=HRNet18, GMacs=392023.03 | 82 | |
| SA-Gate + BMPDepth Data=true, Backbone=ResNet-1012020.07 | 81.7 | |
| EANetBackbone=ResNet-1012021.05 | 81.7 | |
| X-Decoder (L)Type=Open-vocabulary, Backbone=Large2023.03 | 81.7 | |
| SETR-PUPBackbone=T-Large, Training schedule=40k, Inference scale=Multi-scale (MS)2020.12 | 81.57 | |
| DANetDepth Data=false, Backbone=ResNet-1012020.07 | 81.5 | |
| ACFNetDepth Data=false, Backbone=ResNet-1012020.07 | 81.5 | |
| Axial-DeepLab-LBackbone=Axial-ResNet-L, Inference scale=Multi-scale (MS)2020.12 | 81.5 | |
| FAN-S-HybridEncoder Size=26.3M2022.04 | 81.5 | |
| HS3-FuseBackbone=HRNet18, GMacs=392023.03 | 81.4 | |
| CCNetDepth Data=false, Backbone=ResNet-1012020.07 | 81.3 | |
| FAN-T-HybridEncoder Size=7.4M2022.04 | 81.2 | |
| HRNetV2-W48Backbone=HRNet, Model Size=65.9M2020.06 | 81.1 | |
| Axial-DeepLab-XLBackbone=Axial-ResNet-XL, Inference scale=Multi-scale (MS)2020.12 | 81.1 | |
| EMANetBackbone=ResNet-1012021.05 | 81 | |
| PSPNetBackbone=ResNet-1012021.05 | 81 | |
| SegFormer-B2Encoder Size=24.2M2022.04 | 81 | |
| PSANetBackbone=ResNet-1012021.05 | 80.9 | |
| DDFPLabeled image ratio=1/2 (1488)2024.03 | 80.82 | |
| DPCBackbone=Xception-71, Extra COCO dataset for training=true2018.11 | 80.8 | |
| GSCNNDepth Data=false, Backbone=WideResNet-1012020.07 | 80.8 | |
| SA-Gate + BMPDepth Data=true, Backbone=ResNet-502020.07 | 80.7 | |
| DMNetBackbone=ResNet-1012021.05 | 80.7 | |
| GCNetBackbone=ResNet-1012021.05 | 80.7 | |
| Deeplabv3#params.=87.1M, FLOPs=1394.0G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 80.7 | |
| OCRBackbone=HRNet18, GMacs=392023.03 | 80.7 | |
| CCNetBackbone=ResNet-1012018.11 | 80.5 | |
| RGB baselineDepth Data=false, Backbone=ResNet-1012020.07 | 80.5 | |
| RGB-D baselineDepth Data=true, Backbone=ResNet-1012020.07 | 80.5 | |
| Mask2Former (T)Type=Closed-set, Backbone=Tiny2023.03 | 80.5 | |
| Mask2FormerBackbone=Swin-T, Param=47.4M2026.05 | 80.5 | |
| AugSegLabeled image ratio=1/2 (1488)2024.03 | 80.43 | |
| DeeplabV3Backbone=ResNeSt-1012020.04 | 80.42 | |
| MDEQ-XLBackbone=MDEQ, Model Size=70.9M2020.06 | 80.3 | |
| Softmax EntropyRetrain=false2021.03 | 80.3 | |
| Embedding DensityRetrain=false2021.03 | 80.3 | |
| ANNBackbone=ResNet-1012021.05 | 80.3 | |
| OpenSeeD (T)Type=Open-vocabulary, Backbone=Tiny2023.03 | 80.3 | |
| CPSLabeled image ratio=1/2 (1488)2024.03 | 80.21 | |
| CCNetBackbone=ResNet-1012020.12 | 80.2 | |
| MambaPanopticBackbone=SegMan, Param=35.7M2026.05 | 80.18 | |
| OCNetBackbone=ResNet1012020.04 | 80.1 | |
| BiAlignNetgamma (down-sampling ratio)=1, Backbone=DFNet2, FPS=32, Parameters=19.2M, Pre-training=Mapillary dataset, Hardware=1080Ti GPU2021.05 | 80.1 | |
| PSPNet#params.=68.0M, FLOPs=1028.8G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 80 | |
| APCNetBackbone=ResNet-1012021.05 | 79.9 | |
| DDFPLabeled image ratio=1/4 (744)2024.03 | 79.88 | |
| DeeplabV3Backbone=ResNeSt-502020.04 | 79.87 | |
| AugSegLabeled image ratio=1/4 (744)2024.03 | 79.56 | |
| UniMatchLabeled image ratio=1/2 (1488)2024.03 | 79.5 | |
| DeeplabV3Backbone=ResNet1012020.04 | 79.42 | |
| CleanBackbone=ResNet502024.10 | 79.4 | |
| SETR-PUPBackbone=T-Large, Training schedule=80k, Inference scale=Single-scale (SS)2020.12 | 79.34 | |
| DeepLabv3Backbone=ResNet-1012018.11 | 79.3 | |
| DeeplabV3Backbone=ResNet1012020.04 | 79.3 | |
| DeepLab-v3Backbone=ResNet-101, Inference scale=Multi-scale (MS)2020.12 | 79.3 |