Panoptic Segmentation on Cityscapes
67.2PQDINAT-L
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| DINAT-LBackbone=DINAT-L, Win. Size=11 x 11, # of Params=220 M, FLOPs=525 G, Pre-trained=ImageNet-22K, Resolution=800x800, Framework=Mask2Former2022.09 | 67.2 | 44.5 | 83.4 | — | — | — | — | |
| Swin-LBackbone=Swin-L, Win. Size=12 x 12, # of Params=216 M, FLOPs=643 G, Pre-trained=ImageNet-22K, Resolution=800x800, Framework=Mask2Former2022.09 | 66.6 | 43.6 | 82.9 | — | — | — | — | |
| ReMaxBackbone=Res502024.04 | 65.4 | — | — | — | — | 294.7 | — | |
| ECO-M2FBackbone=SWIN-T, beta=0.0032024.04 | 64.18 | 39.64 | 80.49 | — | — | 507.51 | 250.8 | |
| M2FBackbone=SWIN-T2024.04 | 64 | 39.26 | 80.77 | — | — | 537.85 | 281.13 | |
| Lite-ECO-M2FBackbone=SWIN-T2024.04 | 62.64 | 36.52 | 79.99 | — | — | 412.88 | 156.17 | |
| Lite-M2FBackbone=SWIN-T2024.04 | 62.29 | 36.57 | 79.43 | — | — | 428.71 | 172 | |
| ECO-M2FBackbone=Res502024.04 | 62.2 | 37.21 | 77.34 | — | — | 453.5 | 220.59 | |
| Mask2Former-R50GFLOPs=527.4, Params (M)=44.0, FPS=2.42026.04 | 62.1 | — | — | — | — | — | — | |
| ECO-M2FBackbone=SWIN-T, beta=0.012024.04 | 62.09 | 36.04 | 79.58 | — | — | 439.67 | 182.95 | |
| M2FBackbone=Res502024.04 | 61.86 | 37.35 | 76.94 | — | — | 524.11 | 281.13 | |
| PEMBackbone=Res502024.04 | 61.07 | 34.11 | 77.62 | — | — | 236.6 | — | |
| RT-M2FBackbone=SWIN-T2024.04 | 59.73 | 31.35 | 77.89 | — | — | 361.1 | 130 | |
| YOSOBackbone=Res502024.04 | 59.7 | — | 76.05 | — | — | 265.1 | — | |
| LiPS (3 levels)GFLOPs=91.7, Params (M)=19.8, FPS=8.52026.04 | 55.3 | — | — | — | — | — | — | |
| LiPS (full)GFLOPs=121.5, Params (M)=19.7, FPS=4.52026.04 | 55.3 | — | — | — | — | — | — | |
| LiPS (2 levels)GFLOPs=84.2, Params (M)=19.9, FPS=10.72026.04 | 54.5 | — | — | — | — | — | — | |
| LiPS (1 level)GFLOPs=77.4, Params (M)=19.9, FPS=10.82026.04 | 54.1 | — | — | — | — | — | — | |
| PrAda-LPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 49.8 | — | 66.2 | — | — | — | — | |
| FC-CLIP-L + CLIP-AdapterPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 48.6 | — | 64.3 | — | — | — | — | |
| FC-CLIP-L + TipAdapter-FPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 48 | — | 63.2 | — | — | — | — | |
| FC-CLIP-L + CoCoOpPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 46.9 | — | 60.5 | — | — | — | — | |
| FC-CLIP-L + CoOpPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 46.8 | — | 59.3 | — | — | — | — | |
| PrAda-R50Prompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 45.5 | — | 61.4 | — | — | — | — | |
| OVRCOAT2026.03 | 45.3 | — | — | 78.7 | 55.6 | — | — | |
| FC-CLIP-R50 + CLIP-AdapterPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 44.8 | — | 60.8 | — | — | — | — | |
| FC-CLIP-R50 + TipAdapter-FPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 44.7 | — | 59.6 | — | — | — | — | |
| FC-CLIP2026.03 | 44 | — | — | 75.4 | 53.6 | — | — | |
| FC-CLIP-LPrompt Type=T, Pre-Training Data=COCO-Panoptic, Adaptation Data=-2026.05 | 44 | — | 56.2 | — | — | — | — | |
| OPSNet2026.03 | 41.5 | — | — | 67.5 | 50 | — | — | |
| FC-CLIP-R50 + CoOpPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 41.5 | — | 51.9 | — | — | — | — | |
| OpenSeeD (L)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 41.4 | — | — | — | — | — | — | |
| OpenSEED-LPrompt Type=T, Pre-Training Data=COCO + O365, Adaptation Data=-2026.05 | 41.4 | — | 47.8 | — | — | — | — | |
| FC-CLIP-R50Prompt Type=T, Pre-Training Data=COCO-Panoptic, Adaptation Data=-2026.05 | 40.3 | — | 53.2 | — | — | — | — | |
| MAFT+pan2026.03 | 38.3 | — | — | 70.2 | 46.9 | — | — | |
| X-Decoder (L)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 38.1 | — | — | — | — | — | — | |
| X-Decoder-LPrompt Type=T, Pre-Training Data=COCO + CC3M + . . ., Adaptation Data=-2026.05 | 38.1 | — | 52 | — | — | — | — | |
| OpenSeeD (T)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 37.3 | — | — | — | — | — | — | |
| MSeg (B)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=false, Evaluation Protocol=Supervised, Backbone=Base2023.03 | 37.2 | — | — | — | — | — | — | |
| X-Decoder (T)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 37.2 | — | — | — | — | — | — | |
| Prompt-DINO-LPrompt Type=V, Pre-Training Data=COCO + O365 + CC3M + SA-1B + . . ., Adaptation Data=ND2026.05 | 34.3 | — | 52.2 | — | — | — | — | |
| DaTaSegBackbone=R-50, Training data=COCO panoptic2023.06 | 30 | — | — | — | — | — | — | |
| DaTaSegBackbone=ViTDet-L, Training data=COCO panoptic + ADE semantic + O365 bbox2023.06 | 29.8 | — | — | — | — | — | — | |
| APE-LPrompt Type=T, Pre-Training Data=COCO + O365 + OpenImages + . . ., Adaptation Data=-2026.05 | 28.6 | — | 37.9 | — | — | — | — | |
| DaTaSegBackbone=ViTDet-B, Training data=COCO panoptic + ADE semantic2023.06 | 28 | — | — | — | — | — | — | |
| ODISEBackbone=UNet+M2F, Training data=LAION+CLIP+COCO2023.06 | 23.9 | — | — | — | — | — | — | |
| ODISE2026.03 | 23.9 | — | — | 75.3 | 29 | — | — | |
| ODISEPrompt Type=T, Pre-Training Data=COCO-Panoptic, Adaptation Data=-2026.05 | 23.9 | — | — | — | — | — | — |