Instance Segmentation on ADE20K
32.6AP (Mask)MSeg (B)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MSeg (B)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=false, Evaluation Protocol=Supervised, Backbone=Base2023.03 | 32.6 | — | — | — | — | |
| OpenSeeD (L)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 15 | — | — | — | — | |
| HIPIEBackbone=ViT-H2023.07 | 15 | — | — | — | — | |
| HIPIEBackbone=ViT-H2023.07 | 15 | — | — | — | — | |
| ODISEBackbone=ViT-H+SD2023.07 | 14.4 | — | — | — | — | |
| ODISEBackbone=ViT-H+SD2023.07 | 14.4 | — | — | — | — | |
| OpenSeeD (T)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 14.1 | — | — | — | — | |
| ODISE (H)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Huge2023.03 | 13.9 | — | — | — | — | |
| X-Decoder (L)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 13.1 | — | — | — | — | |
| HIPIEBackbone=RN502023.07 | 13 | — | — | — | — | |
| HIPIEBackbone=RN502023.07 | 13 | — | — | — | — | |
| X-DecoderBackbone=DaViT-B2023.07 | 11.7 | — | — | — | — | |
| X-DecoderBackbone=DaViT-B2023.07 | 11.7 | — | — | — | — | |
| X-Decoder (T)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 9.8 | — | — | — | — | |
| X-DecoderBackbone=FocalT2023.07 | 9.8 | — | — | — | — | |
| X-DecoderBackbone=FocalT2023.07 | 9.8 | — | — | — | — | |
| MaskCLIP (L)Training Data (SEG)=false, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 6 | — | — | — | — | |
| MaskCLIPBackbone=ViT162023.07 | 6 | — | — | — | — | |
| MaskCLIPBackbone=ViT162023.07 | 6 | — | — | — | — | |
| DINAT-LFramework=Mask2Former [5], Win. Size=11 x 11, # of Params=220 M, FLOPs=535 G, Pre-trained=ImageNet-22K, Resolution=800x8002022.09 | — | 35.4 | 16.3 | 39 | 55.5 | |
| GLIDType=Generalist, Backbone=Swin-B, Data=ImageNet-1K, w/ Labels=false2024.04 | — | 30.9 | — | — | — | |
| GLIDType=Generalist, Backbone=Swin-L, Data=ImageNet-1K, w/ Labels=false2024.04 | — | 32.5 | — | — | — | |
| Mask2FormerType=Specialist, Backbone=Swin-B2024.04 | — | 30.7 | — | — | — | |
| MaskCLIPTrainable Params (M)=354.1 (100%), Total Params (M)=354.12023.12 | — | 6.1 | — | — | — | |
| ODISETrainable Params (M)=28.1 (1.85%), Total Params (M)=1522.12023.12 | — | 13.9 | — | — | — | |
| OpenSeeDTrainable Params (M)=116.2 (100%), Total Params (M)=116.22023.12 | — | 15 | — | — | — | |
| OVCISTrainable Params (M)=28.7 (1.88%), Total Params (M)=1522.72023.12 | — | 14.1 | — | — | — | |
| Swin-LFramework=Mask2Former [5], Win. Size=12 x 12, # of Params=216 M, FLOPs=654 G, Pre-trained=ImageNet-22K, Resolution=800x8002022.09 | — | 34.9 | 16.3 | 40 | 54.7 | |
| X-DecoderTrainable Params (M)=38.3 (100%), Total Params (M)=38.32023.12 | — | 13.1 | — | — | — |