Semantic Segmentation on Cityscapes (val) (mIoU, mIoU (+MS))
0.833mIoUMask2Former
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Mask2FormerBackbone=Swin-L, Pre-training=ImageNet-22K, #Param=216M, FLOPs=2113G2023.03 | 0.833 | 0.843 | |
| DDPBackbone=ConvNext-L, Sampling steps=3, Pre-training=ImageNet-22K, #Param=209M, FLOPs=3245G2023.03 | 0.8321 | 0.8392 | |
| DDPBackbone=ConvNext-L, Sampling steps=1, Pre-training=ImageNet-22K, #Param=209M, FLOPs=2139G2023.03 | 0.8295 | 0.8376 | |
| DDPBackbone=ConvNext-B, Sampling steps=3, #Param=100M, FLOPs=2447G2023.03 | 0.8278 | 0.8349 | |
| DiversePatchBackbone=Swin-L, Pre-training=ImageNet-22K, #Param=234M, FLOPs=3190G2023.03 | 0.827 | 0.836 | |
| DDPBackbone=ConvNext-S, Sampling steps=3, #Param=62M, FLOPs=2166G2023.03 | 0.8269 | 0.8358 | |
| DDPBackbone=ConvNext-T, Sampling steps=3, #Param=40M, FLOPs=1989G2023.03 | 0.826 | 0.8315 | |
| DDPBackbone=ConvNext-B, Sampling steps=1, #Param=100M, FLOPs=1340G2023.03 | 0.8259 | 0.8347 | |
| DDPBackbone=Swin-B, Sampling steps=3, #Param=99M, FLOPs=2464G2023.03 | 0.8254 | 0.8342 | |
| DDPBackbone=Swin-S, Sampling steps=3, #Param=61M, FLOPs=2174G2023.03 | 0.8241 | 0.8321 | |
| DDPBackbone=Swin-B, Sampling steps=1, #Param=99M, FLOPs=1357G2023.03 | 0.8237 | 0.8336 | |
| DDPBackbone=ConvNext-S, Sampling steps=1, #Param=62M, FLOPs=1059G2023.03 | 0.8237 | 0.8338 | |
| DDPBackbone=ConvNext-T, Sampling steps=1, #Param=40M, FLOPs=883G2023.03 | 0.8233 | 0.83 | |
| SegFormer-B5Backbone=MiT-B5, #Param=85M, FLOPs=1448G2023.03 | 0.8225 | 0.8348 | |
| DDPBackbone=Swin-S, Sampling steps=1, #Param=61M, FLOPs=1067G2023.03 | 0.8217 | 0.8306 | |
| OCRNetBackbone=HRFormer-B, #Param=56M, FLOPs=2240G2023.03 | 0.819 | 0.826 | |
| DDPBackbone=Swin-T, Sampling steps=3, #Param=39M, FLOPs=1992G2023.03 | 0.8124 | 0.8246 | |
| DDPBackbone=Swin-T, Sampling steps=1, #Param=39M, FLOPs=885G2023.03 | 0.8096 | 0.8225 | |
| StructTokenBackbone=ViT-L, Pre-training=ImageNet-22K, #Param=364M, FLOPs=2913G2023.03 | 0.8005 | 0.8207 | |
| SETR-PUPBackbone=ViT-L, Pre-training=ImageNet-22K, #Param=318M, FLOPs=2955G2023.03 | 0.7934 | 0.8215 | |
| SegmenterBackbone=ViT-L, #Param=333M, FLOPs=2685G2023.03 | 0.791 | 0.813 |