Semantic Segmentation on Cityscapes 17 (val)
84.8mIoUMask2Former
Evaluation Results
| Method | Links | |
|---|---|---|
| Mask2FormerBackbone=ViT-L [23], Pre-training=DINOv2 + DA, Input size=896 x 17922025.03 | 84.8 | |
| Mask2FormerBackbone=ViT-Adapter-L [13], Pre-training=DINOv2, Params=351M, Input size=1024x1024, GFLOPs=5200, FPS=7, re-implementation=true2025.03 | 84.5 | |
| EoMTBackbone=ViT-L [23], Pre-training=DINOv2, Params=319M, Input size=1024x1024, GFLOPs=4350, FPS=252025.03 | 84.2 | |
| OneFormerBackbone=ConvNext-XL [46], Pre-training=IN21K, Params=373M, Input size=1024 x 2048, GFLOPs=775, FPS=72025.03 | 83.6 | |
| kMaX-DeepLabBackbone=ConvNext-L [46], Pre-training=IN21K, Params=232M, Input size=1025 x 2049, GFLOPs=16732025.03 | 83.5 | |
| Mask2FormerBackbone=Swin-L [45], Pre-training=IN21K, Params=216M, Input size=1024 x 2048, FPS=142025.03 | 83.3 | |
| OneFormerBackbone=DiNAT-L [30], Pre-training=IN21K, Params=223M, Input size=1024 x 2048, GFLOPs=450, FPS=142025.03 | 83.1 |