Panoptic Segmentation on Cityscapes (val)
70.8PQOneFormer + ViT-P
Evaluation Results
| Method | Links | ||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| OneFormer + ViT-PBackbone=InternImage-H [46], Coarse=true, number of parameters=1.4B, queries=250, Crop Size=512x10242025.05 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=InternImage-H [46], Coarse=false, number of parameters=1.1B, queries=250, Crop Size=512x10242025.05 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=ConvNeXt-L [34], Coarse=false, number of parameters=220M, queries=250, Crop Size=512x1024, Pre-training=COCO and Objects3652025.05 | 70 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormer + ViT-PBackbone=ConvNeXt-L [34], Coarse=true, number of parameters=306M, queries=250, Crop Size=512x10242025.05 | 70 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=ConvNeXt-XL [34], Coarse=false, number of parameters=372M, queries=250, Crop Size=512x1024, Pre-training=Mapillary Vistas2025.05 | 69.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet-(1, 1, 4.5), Multi-scale (MS)=true, Extra Data=MV2020.11 | 69.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 85.3 | 46.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet, Crop Size=1025x2049, Extra Data=true, Multi-Scale (PQ & AP)=true2022.11 | 69.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (L)Type=Open-vocabulary, Backbone=Large2023.03 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD+Backbone=Swin-L [32], Coarse=false, number of parameters=286M, queries=300, Crop Size=512x1024, Pre-training=COCO and Objects3652025.05 | 68.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLExtra Data=MV (Mapillary Vistas), Multi-scale inputs=true2020.03 | 68.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 84.6 | 44.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLMulti-scale (MS)=true, Extra Data=MV2020.11 | 68.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 84.6 | 44.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet-(1, 1, 4.5), Multi-scale (MS)=false, Extra Data=MV2020.11 | 68.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 84.6 | 42.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=ConvNeXt-L [39], number of parameters=220M, GFLOPS=497G, number of queries=250, Crop Size=512x1024, Iters=90k, Training Strategy=Joint Training2022.11 | 68.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLBackbone=Axial ResNet-XL, Number of parameters=173M, Crop Size=1025x2049, Extra Data=true, Multi-Scale (PQ & AP)=true2022.11 | 68.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet, Crop Size=1025x2049, Extra Data=true, Multi-Scale (PQ & AP)=false2022.11 | 68.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=ConvNeXt-L, Number of parameters=220M, Crop Size=512x1024, Extra Data=false, Multi-Scale (PQ & AP)=false2022.11 | 68.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=ConvNeXt-L [34], Coarse=false, number of parameters=220M, queries=250, Crop Size=512x10242025.05 | 68.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| kMaX-DeepLab+Backbone=ConvNeXt-L [39], number of parameters=232M, GFLOPS=1673G, number of queries=256, Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 68.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=ConvNeXt-XL+ [39], number of parameters=372M, GFLOPS=775G, number of queries=250, Crop Size=512x1024, Iters=90k, Training Strategy=Joint Training2022.11 | 68.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| kMaX-DeepLabBackbone=ConvNeXt-L, Number of parameters=232M, Crop Size=1025x2049, Extra Data=false, Multi-Scale (PQ & AP)=false2022.11 | 68.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=ConvNeXt-XL, Number of parameters=372M, Crop Size=512x1024, Extra Data=false, Multi-Scale (PQ & AP)=false2022.11 | 68.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLExtra Data=MV (Mapillary Vistas), Multi-scale inputs=false2020.03 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 84.2 | 41.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLMulti-scale (MS)=false, Extra Data=MV2020.11 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 84.2 | 41.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLBackbone=Axial ResNet-XL, Number of parameters=123M, Crop Size=1025x2049, Extra Data=true, Multi-Scale (PQ & AP)=false2022.11 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-LExtra Data=MV (Mapillary Vistas), Multi-scale inputs=true2020.03 | 67.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 83.8 | 42.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=DINAT-L+ [21], number of parameters=223M, GFLOPS=450G, number of queries=250, Crop Size=512x1024, Iters=90k, Training Strategy=Joint Training2022.11 | 67.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=DINAT-L, Number of parameters=223M, Crop Size=512x1024, Extra Data=false, Multi-Scale (PQ & AP)=false2022.11 | 67.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet-(1, 1, 4.5), Multi-scale (MS)=true2020.11 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.9 | 43.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientPSMode=Multi-Scale, Pre-training=Vistas2020.04 | 67.5 | — | — | — | 63.5 | 70.4 | — | — | — | — | 83.2 | 80.2 | 82.2 | 77.2 | 83.9 | 82.4 | — | — | — | — | 82.1 | 43.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet, Inference scale=multi-scale2021.12 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.9 | — | — | — | — | — | — | — | — | — | 43.9 | — | — | — | — | — | |
| EfficientPSBackbone=EfficientNet, Crop Size=1025x2049, Extra Data=true, Multi-Scale (PQ & AP)=true2022.11 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MP-Formerbackbone=Swin-L2023.03 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 45.8 | 83.5 | — | — | — | — | |
| OneFormerBackbone=Swin-L+ [38], number of parameters=219M, GFLOPS=543G, number of queries=250, Crop Size=512x1024, Iters=90k, Training Strategy=Joint Training2022.11 | 67.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=Swin-L, Number of parameters=219M, Crop Size=512x1024, Extra Data=false, Multi-Scale (PQ & AP)=false2022.11 | 67.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormer (L)Type=Closed-set, Backbone=Large2023.03 | 67.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabExtra Data=MV (Mapillary Vistas), Multi-scale inputs=true2020.03 | 67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 83.1 | 42.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Xception-71, Multi-scale (MS)=true, Extra Data=MV2020.11 | 67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 83.1 | 42.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeeplabMode=Multi-Scale, Pre-training=Vistas2020.04 | 67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 83.1 | 42.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-L, Pre-training=ImageNet-22K, Inference scale=single-scale2021.12 | 66.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.9 | — | — | — | — | — | — | — | — | — | 43.6 | — | — | — | — | — | |
| Panoptic-PartFormerBackbone=Swin-base2022.04 | 66.6 | — | — | — | 61.7 | 70.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former-PanopticBackbone=Swin-L+ [38], number of parameters=216M, GFLOPS=514G, number of queries=200, Crop Size=512x1024, Iters=90k, Training Strategy=Individual Training2022.11 | 66.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former-PanopticBackbone=Swin-L, Number of parameters=216M, Crop Size=512x1024, Extra Data=false, Multi-Scale (PQ & AP)=false2022.11 | 66.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former (L)Type=Closed-set, Backbone=Large2023.03 | 66.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Formerbackbone=Swin-L2023.03 | 66.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 43.6 | 82.9 | — | — | — | — | |
| Mask2Former-PanopticBackbone=Swin-L [32], Coarse=false, number of parameters=216M, queries=200, Crop Size=512x10242025.05 | 66.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-LExtra Data=MV (Mapillary Vistas), Multi-scale inputs=false2020.03 | 66.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 83.2 | 40.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet-(1, 1, 4.5), Multi-scale (MS)=false2020.11 | 66.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.2 | 40.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet, Inference scale=single-scale2021.12 | 66.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.2 | — | — | — | — | — | — | — | — | — | 40.1 | — | — | — | — | — | |
| Panoptic-DeepLab+Backbone=SWideRNet+ [8], number of parameters=536M, GFLOPS=10365G, Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 66.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet, Crop Size=1025x2049, Extra Data=false, Multi-Scale (PQ & AP)=false2022.11 | 66.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet [10], Coarse=false, number of parameters=536M, Crop Size=1025×20492025.05 | 66.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientPSMode=Single-Scale, Pre-training=Vistas2020.04 | 66.1 | — | — | — | 62.7 | 68.5 | — | — | — | — | 82.5 | 78.9 | 81.9 | 75.2 | 82.9 | 81.6 | — | — | — | — | 81 | 41.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-B, Pre-training=ImageNet-22K, Inference scale=single-scale2021.12 | 66.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.7 | — | — | — | — | — | — | — | — | — | 42.8 | — | — | — | — | — | |
| Mask2Former (B)Type=Closed-set, Backbone=Base2023.03 | 66.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic FCNBackbone=Swin-L, Pre-training=ImageNet-22K, Inference scale=single-scale2021.12 | 65.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WOW-SegProtocol=Open-vocabulary, Evaluation Input=Ground truth box/mask2026.05 | 65.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X-Decoder (L)Type=Open-vocabulary, Backbone=Large2023.03 | 65.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabExtra Data=MV (Mapillary Vistas), Multi-scale inputs=false2020.03 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.5 | 38.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Xception-71, Multi-scale (MS)=false, Extra Data=MV2020.11 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.5 | 38.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeeplabMode=Single-Scale, Pre-training=Vistas2020.04 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.5 | 38.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLMulti-scale inputs=true2020.03 | 65.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.1 | 39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLMulti-scale (MS)=true2020.11 | 65.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.1 | 39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientPSMode=Multi-Scale2020.04 | 65.1 | — | — | — | 61.5 | 67.7 | — | — | — | — | 82.2 | 79 | 81.4 | 75.4 | 82.8 | 81.7 | — | — | — | — | 80.3 | 39.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeamlessExtra Data=MV (Mapillary Vistas), Multi-scale inputs=false2020.03 | 65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeamlessMulti-scale (MS)=false, Extra Data=MV2020.11 | 65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeamlessMode=Single-Scale, Pre-training=Vistas2020.04 | 65 | — | — | — | 60.7 | 68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MambaPanopticBackbone=SegMan, Param=35.7M2026.05 | 64.89 | — | — | — | 58.26 | 69.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-LMulti-scale inputs=true2020.03 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.5 | 37.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CMT-DeepLab-S2022.06 | 64.6 | — | — | — | — | — | — | — | — | — | 82.6 | 77.4 | — | — | — | — | — | — | — | — | 81.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CMT-DeepLabBackbone=MaX-S [50], Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLMulti-scale inputs=false2020.03 | 64.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.6 | 36.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLMulti-scale (MS)=false2020.11 | 64.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.6 | 36.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XL+Backbone=Axial ResNet-XL [51], number of parameters=173M, GFLOPS=2447G, Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 64.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLBackbone=Axial ResNet-XL, Number of parameters=173M, Crop Size=1025x2049, Extra Data=false, Multi-Scale (PQ & AP)=false2022.11 | 64.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-XLBackbone=Axial ResNet-XL [44], Coarse=false, number of parameters=173M, Crop Size=1025×20492025.05 | 64.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabMulti-scale inputs=true2020.03 | 64.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.5 | 38.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Xception-71, Multi-scale (MS)=true2020.11 | 64.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.5 | 38.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabMode=Multi-Scale2020.04 | 64.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.5 | 38.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| + FSFBackbone=R-50, Extra Data=None, adaptive kernel fusion=true, full-scale fine-tuning=true2022.06 | 64.1 | — | — | — | 58.8 | 68.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic FCN++Backbone=Swin-large2022.04 | 64.1 | — | — | — | 55.6 | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-LMulti-scale inputs=false2020.03 | 63.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81 | 35.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DLBackbone=Axial-L2021.06 | 63.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientPSBackbone=Custom, Mask selection=true2021.06 | 63.9 | — | — | — | 66.2 | 60.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientPSInput Size (pixels)=1024 x 2048, Params. (M)=40.89, FLOPs (B)=433.94, Time (ms)=1662020.04 | 63.9 | — | — | — | 60.7 | 66.2 | — | — | — | — | 81.5 | 77.1 | 81.2 | 74.1 | 81.8 | 79.2 | — | — | — | — | 79.3 | 38.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientPSMode=Single-Scale2020.04 | 63.9 | — | — | — | 60.7 | 66.2 | — | — | — | — | 81.5 | 77.1 | 81.2 | 74.1 | 81.8 | 79.2 | — | — | — | — | 79.3 | 38.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-DeepLab-LBackbone=Axial ResNet-L [51], number of parameters=45M, GFLOPS=687G, Crop Size=1025x2049, Iters=60k, Training Strategy=Individual Training2022.11 | 63.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former (T)Type=Closed-set, Backbone=Tiny2023.03 | 63.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (T)Type=Open-vocabulary, Backbone=Tiny2023.03 | 63.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CleanBackbone=Swin-T2024.10 | 63.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 39.1 | 80.8 | — | — | — | — | |
| Mask2FormerBackbone=Swin-T, Param=47.4M2026.05 | 63.9 | — | — | — | 56.2 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=SWideRNet-(0.25, 0.75, 1), Input Size=1025 × 2049, Speed (ms)=166.83, M-Adds (B)=1199.852020.11 | 63.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| + AKFBackbone=R-50, Extra Data=None, adaptive kernel fusion=true2022.06 | 63.6 | — | — | — | 57.2 | 68.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Xception-71, Input Size=1025 x 2049, Speed (ms)=175, M-Adds (B)=547.492019.11 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabMulti-scale inputs=false2020.03 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.5 | 35.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Xception-71, Multi-scale (MS)=false2020.11 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.5 | 35.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Xception-71, Input Size=1025 × 2049, Speed (ms)=175, M-Adds (B)=547.492020.11 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DLBackbone=X-712021.06 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabInput Size (pixels)=1025 x 2049, Params. (M)=46.73, FLOPs (B)=547.49, Time (ms)=1752020.04 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.5 | 35.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabMode=Single-Scale2020.04 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.5 | 35.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Xcp-71, Extra Data=None2022.06 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |