Semantic Segmentation on Cityscapes (val) (Specific mIoU Variants)
86.8mIoU (single-scale)Mask2Former + ViT-P
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Mask2Former + ViT-PBackbone=InternImage-H [46], Coarse=true, number of parameters=1.4B, queries=100, Crop Size=1024x1024, Pre-training=Mapillary Vistas2025.05 | 86.8 | 87.4 | |
| Mask2FormerBackbone=InternImage-H [46], Coarse=false, number of parameters=1.1B, queries=100, Crop Size=1024x1024, Pre-training=COCO and Objects3652025.05 | 86.4 | 87 | |
| OneFormer + ViT-PBackbone=InternImage-H [46], Coarse=true, number of parameters=1.4B, queries=250, Crop Size=512x10242025.05 | 85.4 | 85.9 | |
| OneFormerBackbone=InternImage-H [46], Coarse=false, number of parameters=1.1B, queries=250, Crop Size=512x10242025.05 | 85.1 | 85.7 | |
| OneFormer + ViT-PBackbone=ConvNeXt-L [34], Coarse=true, number of parameters=306M, queries=250, Crop Size=512x10242025.05 | 84.9 | 85.5 | |
| Mask2Former + Depth AnythingBackbone=ViT-L [18], queries=200, Crop Size=896×8962025.05 | 84.8 | 86.2 | |
| OneFormerBackbone=ConvNeXt-L [34], Coarse=false, number of parameters=220M, queries=250, Crop Size=512x1024, Pre-training=COCO and Objects3652025.05 | 84.6 | 85.2 | |
| OneFormerBackbone=ConvNeXt-XL [34], Coarse=false, number of parameters=372M, queries=250, Crop Size=512x1024, Pre-training=Mapillary Vistas2025.05 | 84.5 | 85.8 | |
| OpenSeeD+Backbone=Swin-L [32], Coarse=false, number of parameters=286M, queries=300, Crop Size=512x1024, Pre-training=COCO and Objects3652025.05 | 84.5 | — | |
| Mask2Former-SemanticBackbone=Swin-L [32], Coarse=false, number of parameters=215M, queries=100, Crop Size=512x10242025.05 | 83.3 | 84.3 | |
| OneFormerBackbone=ConvNeXt-L [34], Coarse=false, number of parameters=220M, queries=250, Crop Size=512x10242025.05 | 83 | 84 | |
| Mask2Former-PanopticBackbone=Swin-L [32], Coarse=false, number of parameters=216M, queries=200, Crop Size=512x10242025.05 | 82.9 | — | |
| Panoptic-DeepLabBackbone=SWideRNet [10], Coarse=false, number of parameters=536M, Crop Size=1025×20492025.05 | 82.2 | 82.9 | |
| Axial-DeepLab-XLBackbone=Axial ResNet-XL [44], Coarse=false, number of parameters=173M, Crop Size=1025×20492025.05 | 80.6 | 81.1 |