Semantic Segmentation on Cityscapes 13 (val)
84.8mIoUMask2Former
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mask2FormerBackbone=ViT-L [17], Pre-training=DINOv2 + DA [62], Input size=896 × 17922026.07 | 84.8 | — | — | |
| Mask2FormerBackbone=ViT-Adapter-L [10], Pre-training=DINOv2, Params=351M, Input size=1024²2026.07 | 84.5 | 5,200 | 7 | |
| LUMABackbone=ViT-L [17], Pre-training=DINOv2, Params=320M, Input size=1024²2026.07 | 84.4 | 4,360 | 38 | |
| EoMT‡Backbone=ViT-L [17], Pre-training=DINOv2, Params=319M, Input size=1024²2026.07 | 84.2 | 4,350 | 36 | |
| OneFormer†Backbone=ConvNext-XL [38], Pre-training=IN21K, Params=373M, Input size=1024 × 20482026.07 | 83.6 | 775 | 7 | |
| kMaX-DeepLabBackbone=ConvNext-L [38], Pre-training=IN21K, Params=232M, Input size=1025 × 20492026.07 | 83.5 | 1,673 | — | |
| Mask2Former†Backbone=Swin-L [37], Pre-training=IN21K, Params=216M, Input size=1024 × 20482026.07 | 83.3 | — | 14 | |
| OneFormer†Backbone=DiNAT-L [22], Pre-training=IN21K, Params=223M, Input size=1024 × 20482026.07 | 83.1 | 450 | 14 |