Panoptic Segmentation on ADE20K
49.4PQDINAT-L
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DINAT-LBackbone=DINAT-L, Win. Size=11 x 11, # of Params=220 M, FLOPs=542 G, Pre-trained=ImageNet-22K, Resolution=800x800, Framework=Mask2Former2022.09 | 49.4 | 35 | 56.3 | — | — | — | |
| Swin-LBackbone=Swin-L, Win. Size=12 x 12, # of Params=216 M, FLOPs=660 G, Pre-trained=ImageNet-22K, Resolution=800x800, Framework=Mask2Former2022.09 | 48.1 | 34.2 | 54.5 | — | — | — | |
| GLIDType=Generalist, Backbone=Swin-L, Data=ImageNet-1K, w/ Labels=false2024.04 | 45.7 | — | — | — | — | — | |
| GLIDType=Generalist, Backbone=Swin-B, Data=ImageNet-1K, w/ Labels=false2024.04 | 44.7 | — | — | — | — | — | |
| Mask2FormerType=Specialist, Backbone=Swin-B2024.04 | 44.3 | — | — | — | — | — | |
| Mask2Former-R50Model Variant=Mask2Former-R50, Input image size=640×640, Batch size=1, Inference scale=single-scale, Precision=FP16, Platform=NVIDIA Jetson AGX Orin2026.04 | 39.6 | 26.5 | 46 | 147.2 | 44 | 7.1 | |
| LiPSModel Variant=LiPS (full), Input image size=640×640, Batch size=1, Inference scale=single-scale, Precision=FP16, Platform=NVIDIA Jetson AGX Orin2026.04 | 36.4 | 22.1 | 45.3 | 36.8 | 19.8 | 10.7 | |
| LiPSModel Variant=LiPS (3 levels), Input image size=640×640, Batch size=1, Inference scale=single-scale, Precision=FP16, Platform=NVIDIA Jetson AGX Orin2026.04 | 36.1 | 22 | 44.4 | 28.4 | 19.9 | 15.7 | |
| Prompt-DINO-LPrompt Type=V, Pre-Training Data=COCO + O365 + CC3M + SA-1B + . . ., Adaptation Data=ND2026.05 | 35.9 | 28 | — | — | — | — | |
| LiPSModel Variant=LiPS (2 levels), Input image size=640×640, Batch size=1, Inference scale=single-scale, Precision=FP16, Platform=NVIDIA Jetson AGX Orin2026.04 | 35.8 | 21.4 | 44 | 26.4 | 20 | 17.5 | |
| LiPSModel Variant=LiPS (1 level), Input image size=640×640, Batch size=1, Inference scale=single-scale, Precision=FP16, Platform=NVIDIA Jetson AGX Orin2026.04 | 34.8 | 19.8 | 43.9 | 24.6 | 20.1 | 18.3 | |
| MSeg (B)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=false, Evaluation Protocol=Supervised, Backbone=Base2023.03 | 33.7 | — | — | — | — | — | |
| PrAda-LPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 31.4 | 18.1 | 38.2 | — | — | — | |
| FC-CLIP-L + CLIP-AdapterPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 31.1 | 19.2 | 37.5 | — | — | — | |
| FC-CLIP-L + TipAdapter-FPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 30.3 | 17.9 | 38.5 | — | — | — | |
| kNN-CLIPPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=Full dataset2026.05 | 29.6 | 17.5 | 41.3 | — | — | — | |
| Prompt-DINO-LPrompt Type=T, Pre-Training Data=COCO + O365 + CC3M + SA-1B + . . ., Adaptation Data=-2026.05 | 29.6 | 24.6 | — | — | — | — | |
| MAFT-LPrompt Type=T, Pre-Training Data=COCO-Panoptic, Adaptation Data=-2026.05 | 27.1 | — | 36.1 | — | — | — | |
| FC-CLIP-LPrompt Type=T, Pre-Training Data=COCO-Panoptic, Adaptation Data=-2026.05 | 26.8 | 16.8 | 34.1 | — | — | — | |
| APE-LPrompt Type=T, Pre-Training Data=COCO + O365 + OpenImages + . . ., Adaptation Data=-2026.05 | 26.6 | 23.8 | 28.9 | — | — | — | |
| FC-CLIP-L + CoOpPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 26.5 | 16.4 | 31.6 | — | — | — | |
| FC-CLIP-L + CoCoOpPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 26.4 | 16.1 | 31.9 | — | — | — | |
| PrAda-R50Prompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 26 | 14.5 | 31.6 | — | — | — | |
| ODISE (H)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Huge2023.03 | 23.5 | — | — | — | — | — | |
| DINOv-LPrompt Type=V, Pre-Training Data=COCO, SA-1B, Adaptation Data=16 imgs/class2026.05 | 23.2 | 15.1 | 25.3 | — | — | — | |
| ODISEBackbone=ViT-H+SD2023.07 | 22.6 | — | — | — | — | — | |
| ODISEBackbone=ViT-H+SD2023.07 | 22.6 | — | — | — | — | — | |
| ODISEPrompt Type=T, Pre-Training Data=COCO-Panoptic, Adaptation Data=-2026.05 | 22.6 | 14.4 | 29.9 | — | — | — | |
| X-Decoder (L)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 21.8 | — | — | — | — | — | |
| X-Decoder-LPrompt Type=T, Pre-Training Data=COCO + CC3M + . . ., Adaptation Data=-2026.05 | 21.8 | 13.1 | 29.6 | — | — | — | |
| FC-CLIP-R50 + CLIP-AdapterPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 21.6 | 11.6 | 26.9 | — | — | — | |
| FC-CLIP-R50 + TipAdapter-FPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 21.4 | 10.6 | 28.1 | — | — | — | |
| X-DecoderBackbone=DaViT-B2023.07 | 21.1 | — | — | — | — | — | |
| X-DecoderBackbone=DaViT-B2023.07 | 21.1 | — | — | — | — | — | |
| HIPIEBackbone=ViT-H2023.07 | 20.6 | — | — | — | — | — | |
| HIPIEBackbone=ViT-H2023.07 | 20.6 | — | — | — | — | — | |
| OpenSeeD (T)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 19.8 | — | — | — | — | — | |
| FC-CLIP-R50 + CoOpPrompt Type=T+V, Pre-Training Data=COCO-Panoptic, Adaptation Data=5 imgs/class2026.05 | 19.8 | 10.2 | 23.9 | — | — | — | |
| OpenSeeD (L)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 19.7 | — | — | — | — | — | |
| OpenSEED-LPrompt Type=T, Pre-Training Data=COCO + O365, Adaptation Data=-2026.05 | 19.7 | 15 | 23.4 | — | — | — | |
| DINOv-TPrompt Type=V, Pre-Training Data=COCO, SA-1B, Adaptation Data=16 imgs/class2026.05 | 19.4 | 11.4 | 21.9 | — | — | — | |
| X-Decoder (T)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 18.8 | — | — | — | — | — | |
| X-DecoderBackbone=FocalT2023.07 | 18.8 | — | — | — | — | — | |
| X-DecoderBackbone=FocalT2023.07 | 18.8 | — | — | — | — | — | |
| HIPIEBackbone=RN502023.07 | 18.4 | — | — | — | — | — | |
| HIPIEBackbone=RN502023.07 | 18.4 | — | — | — | — | — | |
| FC-CLIP-R50Prompt Type=T, Pre-Training Data=COCO-Panoptic, Adaptation Data=-2026.05 | 17.9 | 9.5 | 23.3 | — | — | — | |
| MaskCLIP (L)Training Data (SEG)=false, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 15.1 | — | — | — | — | — | |
| MaskCLIPBackbone=ViT162023.07 | 15.1 | — | — | — | — | — | |
| MaskCLIPBackbone=ViT162023.07 | 15.1 | — | — | — | — | — |