Semantic Segmentation on Cityscapes (val) (mIoU s.s. and mIoU m.s.)
84.2mIoU (small)SegMAN-L
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SegMAN-LParams=92.4M, FLOPs=796G2026.03 | 84.2 | — | |
| SegMAN-BParams=51.8M, FLOPs=479G2026.03 | 83.8 | — | |
| OneFormerBackbone=ConvNeXt-XL+ [39], number of parameters=372M, GFLOPS=775G, number of queries=250, Crop Size=512x1024, Iters=90k, Training Strategy=Joint Training2022.11 | 83.6 | 84.6 | |
| kMaX-DeepLab+Backbone=ConvNeXt-L [39], number of parameters=232M, GFLOPS=1673G, number of queries=256, Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 83.5 | — | |
| Mask2Former-SemanticBackbone=Swin-L+ [38], number of parameters=215M, GFLOPS=494G, number of queries=100, Crop Size=512x1024, Iters=90k, Training Strategy=Individual Training2022.11 | 83.3 | 84.3 | |
| Mask2Former-Swin-BParams=106.5M, FLOPs=1050G, Pre-training=ImageNet22k2026.03 | 83.3 | 84.5 | |
| SegNext-LParams=48.9M, FLOPs=578G2026.03 | 83.2 | 83.9 | |
| LRFormer-LParams=111.0M, FLOPs=908G2026.03 | 83.2 | — | |
| OneFormerBackbone=DINAT-L+ [21], number of parameters=223M, GFLOPS=450G, number of queries=250, Crop Size=512x1024, Iters=90k, Training Strategy=Joint Training2022.11 | 83.1 | 84 | |
| OneFormerBackbone=Swin-L+ [38], number of parameters=219M, GFLOPS=543G, number of queries=250, Crop Size=512x1024, Iters=90k, Training Strategy=Joint Training2022.11 | 83 | 84.4 | |
| OneFormerBackbone=ConvNeXt-L [39], number of parameters=220M, GFLOPS=497G, number of queries=250, Crop Size=512x1024, Iters=90k, Training Strategy=Joint Training2022.11 | 83 | 84 | |
| LRFormer-BParams=67M, FLOPs=555G2026.03 | 83 | — | |
| Mask2Former-PanopticBackbone=Swin-L+ [38], number of parameters=216M, GFLOPS=514G, number of queries=200, Crop Size=512x1024, Iters=90k, Training Strategy=Individual Training2022.11 | 82.9 | — | |
| Mask2Former-Swin-SParams=66.5M, FLOPs=732G2026.03 | 82.6 | 83.6 | |
| ARTA-BaseParams=111.5M, FLOPs=590±40G2026.03 | 82.6 | 83.3 | |
| SegFormer-B5Params=84.7M, FLOPs=1460G2026.03 | 82.4 | 84 | |
| SegFormer-B4Params=64.1M, FLOPs=1241G2026.03 | 82.3 | 83.9 | |
| Panoptic-DeepLab+Backbone=SWideRNet+ [8], number of parameters=536M, GFLOPS=10365G, Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 82.2 | 82.9 | |
| Mask2Former-Swin-TParams=46.5M, FLOPs=537G2026.03 | 82.1 | 83 | |
| HRFormer-BParams=56.2M, FLOPs=2224G2026.03 | 81.9 | 82.6 | |
| ARTA-SmallParams=61.7M, FLOPs=355±25G2026.03 | 81.9 | 83.2 | |
| ARTA-TinyParams=49.5M, FLOPs=286±20G2026.03 | 81.8 | 82.9 | |
| SegFormer-B3Params=47.3M, FLOPs=963G2026.03 | 81.7 | 83.3 | |
| CMT-DeepLabBackbone=MaX-S [50], Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 81.4 | — | |
| Axial-DeepLab-LBackbone=Axial ResNet-L [51], number of parameters=45M, GFLOPS=687G, Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 81 | 81.5 | |
| Axial-DeepLab-XL+Backbone=Axial ResNet-XL [51], number of parameters=173M, GFLOPS=2447G, Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 80.6 | 81.1 |