Instance Segmentation on ADE20K (val)
42.6APOpenSeeD††
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| OpenSeeD††Backbone (Mask Generator)=Swin-L [32], #Params=286M, Crop Size=1280x1280, Pre-trained on Objects365=true2025.05 | 42.6 | — | — | — | — | — | — | — | |
| OneFormer* + ViT-PBackbone (Mask Generator)=DINAT-L [23], #Params=309M, #FLOPS=1955G, Crop Size=1280x1280, Pre-trained on COCO=true2025.05 | 40.7 | — | — | — | — | — | — | — | |
| OneFormer + ViT-PBackbone (Mask Generator)=InternImage-H [46], #Params=1.4B, #FLOPS=4812G, Crop Size=896x8962025.05 | 40.6 | — | — | — | — | — | — | — | |
| OneFormer*Backbone (Mask Generator)=DINAT-L [23], #Params=223M, #FLOPS=1768G, Crop Size=1280x1280, Pre-trained on COCO=true2025.05 | 40.2 | — | — | — | — | — | — | — | |
| OneFormerBackbone (Mask Generator)=InternImage-H [46], #Params=1.1B, #FLOPS=4193G, Crop Size=896x8962025.05 | 40.2 | — | — | — | — | — | — | — | |
| OneFormer + ViT-PBackbone (Mask Generator)=DINAT-L [23], #Params=309M, #FLOPS=1955G, Crop Size=1280x12802025.05 | 37.8 | — | — | — | — | — | — | — | |
| OneFormerBackbone (Mask Generator)=DINAT-L [23], #Params=223M, #FLOPS=1768G, Crop Size=1280x12802025.05 | 37.1 | — | — | — | — | — | — | — | |
| OneFormerBackbone (Mask Generator)=ConvNeXt-XL [34], #Params=372M, #FLOPS=607G, Crop Size=640x6402025.05 | 36.3 | — | — | — | — | — | — | — | |
| OneFormerBackbone (Mask Generator)=ConvNeXt-L [34], #Params=220M, #FLOPS=389G, Crop Size=640x6402025.05 | 36.2 | — | — | — | — | — | — | — | |
| Mask2Former-PanopticBackbone (Mask Generator)=Swin-L [32], #Params=216M, #FLOPS=413G, Crop Size=640x6402025.05 | 34.2 | — | — | — | — | — | — | — | |
| CleanBackbone=Swin-T2024.10 | 27.9 | — | 10.8 | 29.8 | 46.2 | — | — | — | |
| CleanBackbone=ResNet502024.10 | 26.4 | — | 10.4 | 28.9 | 43.1 | — | — | — | |
| ARBackbone=ResNet502024.10 | 25.4 | — | 9.4 | 27.7 | 43.3 | — | — | — | |
| CUDABackbone=ResNet502024.10 | 12 | — | 3.9 | 14.6 | 22.5 | — | — | — | |
| SynPerBackbone=ResNet502024.10 | 9.3 | — | 7.1 | 13.4 | 9.7 | — | — | — | |
| UnSegBackbone=ResNet502024.10 | 6.2 | — | 5 | 8.6 | 7.3 | — | — | — | |
| MaskCLIP (MaskRCNN)Protocol=Cross-Dataset, Mask Proposal Network=MaskRCNN2022.08 | 6.164 | — | — | — | — | — | 12.072 | 5.775 | |
| MaskCLIPProtocol=Cross-Dataset2022.08 | 5.989 | — | — | — | — | — | 9.739 | 6.209 | |
| MaskCLIP w/o RMAProtocol=Cross-Dataset, RMA=false2022.08 | 4.263 | — | — | — | — | — | 6.696 | 4.402 | |
| UnSegBackbone=Swin-T2024.10 | 4.1 | — | 4 | 5.8 | 3.4 | — | — | — | |
| CLIP BaselineProtocol=Cross-Dataset2022.08 | 3.974 | — | — | — | — | — | 6.09 | 4.288 | |
| CLIPTraining=Pre-trained CLIP visual and text encoder2023.03 | — | 5.4 | 5.6 | — | — | 3.5 | 7.7 | 5.8 | |
| D^2Zerotext encoder=w2v2023.05 | — | — | 467 | — | — | — | 702.5 | 481.6 | |
| D^2Zerotext encoder=clip2023.05 | — | — | 609.3 | — | — | — | 899.3 | 627.9 | |
| FreeSeg2023.03 | — | 16.2 | 16.3 | — | — | 15.4 | 25.3 | 16.9 | |
| Full Sup.Supervision=fully-supervised2023.03 | — | 20.1 | 20.3 | — | — | 18.1 | 31.4 | 21.1 | |
| Mask2FormerBackbone=R50, Inference Scale=Single-scale2023.03 | — | 26.4 | 10.4 | 28.9 | 43.1 | — | — | — | |
| Mask2FormerBackbone=Swin-L, Pre-training=ImageNet-22K, Inference Scale=Single-scale2023.03 | — | 34.9 | 16.3 | 40 | 54.7 | — | — | — | |
| Mask2Former (L)Type=Closed-set, Backbone=Large2023.03 | — | 34.2 | — | — | — | — | — | — | |
| Mask2Former (T)Type=Closed-set, Backbone=Tiny2023.03 | — | 26.4 | — | — | — | — | — | — | |
| MP-FormerBackbone=R50, Inference Scale=Single-scale2023.03 | — | 28 | 10.5 | 30.7 | 44.6 | — | — | — | |
| MP-FormerBackbone=Swin-L, Pre-training=ImageNet-22K, Inference Scale=Single-scale2023.03 | — | 35.3 | 16.3 | 40.7 | 55.5 | — | — | — | |
| OneFormer (L)Type=Closed-set, Backbone=Large2023.03 | — | 35.9 | — | — | — | — | — | — | |
| OpenSeeD (L)Type=Open-vocabulary, Backbone=Large2023.03 | — | 42 | — | — | — | — | — | — | |
| OpenSeeD (L)Type=Open-vocabulary, Backbone=Large, Image Size=1280x12802023.03 | — | 42.6 | — | — | — | — | — | — | |
| OpenSeeD (T)Type=Open-vocabulary, Backbone=Tiny2023.03 | — | 35.1 | — | — | — | — | — | — | |
| X-Decoder (L)Type=Open-vocabulary, Backbone=Large2023.03 | — | 35.8 | — | — | — | — | — | — | |
| X-Decoder (T)Type=Open-vocabulary, Backbone=Tiny2023.03 | — | 27.7 | — | — | — | — | — | — | |
| ZSItext encoder=w2v2023.05 | — | — | 0.8 | — | — | — | 0.9 | 0.8 | |
| ZSSeg2023.03 | — | 9.8 | 11 | — | — | 1.8 | 17.8 | 9.5 |