Panoptic Segmentation on ADE20K (val)
54.5PQOneFormer
Evaluation Results
| Method | Links | |||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| OneFormerBackbone (Mask Generator)=InternImage-H [46], #Params=1.1B, #FLOPS=4193G, Crop Size=896x8962025.05 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormer + ViT-PBackbone (Mask Generator)=InternImage-H [46], #Params=1.4B, #FLOPS=4812G, Crop Size=896x8962025.05 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=ViT-Adapter-g+, Pre-training=DINOv2, Params=1216M, Input size=1280x1280, Pre-trained for COCO=true2025.03 | 54.2 | — | — | — | — | 6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 13,790 | — | — | |
| OneFormer* + ViT-PBackbone (Mask Generator)=DINAT-L [23], #Params=309M, #FLOPS=1955G, Crop Size=1280x1280, Pre-trained on COCO=true2025.05 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (L)Type=Open-vocabulary, Backbone=Large, Image Size=1280x12802023.03 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD††Backbone (Mask Generator)=Swin-L [32], #Params=286M, Crop Size=1280x1280, Pre-trained on Objects365=true2025.05 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormer+Backbone=DINAT-L, Pre-training=IN21K, Params=223M, Input size=1280x1280, Pre-trained for COCO=true2025.03 | 53.5 | — | — | — | — | 10 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,369 | — | — | |
| OneFormer*Backbone (Mask Generator)=DINAT-L [23], #Params=223M, #FLOPS=1768G, Crop Size=1280x1280, Pre-trained on COCO=true2025.05 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (L)Type=Open-vocabulary, Backbone=Large2023.03 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former+Backbone=ViT-Adapter-L+, Pre-training=DINOv2, Params=354M, Input size=1280x1280, Pre-trained for COCO=true2025.03 | 53 | — | — | — | — | 10 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 4,817 | — | — | |
| EoMTBackbone=ViT-g, Pre-training=DINOv2, Params=1171M, Input size=1280x1280, Pre-trained for COCO=true2025.03 | 52.8 | — | — | — | — | 12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 12,712 | — | — | |
| Mask2FormerBackbone=ViT-Adapter-g+, Pre-training=DINOv2, Params=1209M, Input size=640x640, Pre-trained for COCO=true2025.03 | 52.6 | — | — | — | — | 20 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,510 | — | — | |
| OneFormer + ViT-PBackbone (Mask Generator)=DINAT-L [23], #Params=309M, #FLOPS=1955G, Crop Size=1280x12802025.05 | 51.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former+Backbone=ViT-Adapter-L+, Pre-training=DINOv2, Params=349M, Input size=640x640, Pre-trained for COCO=true2025.03 | 51.8 | — | — | — | — | 29 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 830 | — | — | |
| EoMTBackbone=ViT-L, Pre-training=DINOv2, Params=322M, Input size=1280x1280, Pre-trained for COCO=true2025.03 | 51.7 | — | — | — | — | 30 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 4,146 | — | — | |
| OneFormerBackbone=DINAT-L, Pretraining=ImageNet-22K, #Params=223M, #FLOPs=1369G, #Queries=250, Crop Size=1280x1280, Iters=160k, Training Strategy=Joint Training2022.11 | 51.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormer+Backbone=DINAT-L, Pre-training=IN21K, Params=223M, Input size=1280x12802025.03 | 51.5 | — | — | — | — | 10 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,369 | — | — | |
| OneFormerBackbone (Mask Generator)=DINAT-L [23], #Params=223M, #FLOPS=1768G, Crop Size=1280x12802025.05 | 51.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=Swin-L, Pretraining=ImageNet-22K, #Params=219M, #FLOPs=1597G, #Queries=250, Crop Size=1280x1280, Iters=160k, Training Strategy=Joint Training2022.11 | 51.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EoMTBackbone=ViT-g, Pre-training=DINOv2, Params=1164M, Input size=640x640, Pre-trained for COCO=true2025.03 | 51.3 | — | — | — | — | 55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,261 | — | — | |
| OneFormerBackbone=DINAT-L, Pretraining=ImageNet-22K, #Params=223M, #FLOPs=678G, #Queries=250, Crop Size=896x896, Iters=160k, Training Strategy=Joint Training2022.11 | 51.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=Swin-L, Pretraining=ImageNet-22K, #Params=219M, #FLOPs=801G, #Queries=250, Crop Size=896x896, Iters=160k, Training Strategy=Joint Training2022.11 | 51.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| kMaX-DeepLabBackbone=ConvNeXt-L, Batch Size=64, #Params=232M, #FLOPs=1302G, #Queries=256, Crop Size=1281x1281, Iters=100k, Training Strategy=Individual Training2022.11 | 50.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| kMaX-DeepLabBackbone=ConvNext-L, Pre-training=IN21K, Params=232M, Input size=1281x12812025.03 | 50.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,302 | — | — | |
| EoMTBackbone=ViT-L, Pre-training=DINOv2, Params=316M, Input size=640x640, Pre-trained for COCO=true2025.03 | 50.6 | — | — | — | — | 128 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 669 | — | — | |
| OneFormerBackbone=DINAT-L, #Params=223M, #FLOPs=359G, #Queries=250, Crop Size=640x640, Iters=160k, Training Strategy=Joint Training2022.11 | 50.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=ConvNeXt-XL, #Params=372M, #FLOPs=607G, #Queries=250, Crop Size=640x640, Iters=160k, Training Strategy=Joint Training2022.11 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone (Mask Generator)=ConvNeXt-XL [34], #Params=372M, #FLOPS=607G, Crop Size=640x6402025.05 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=ConvNeXt-L, Pretraining=ImageNet-22K, #Params=220M, #FLOPs=389G, #Queries=250, Crop Size=640x640, Iters=160k, Training Strategy=Joint Training2022.11 | 50 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone (Mask Generator)=ConvNeXt-L [34], #Params=220M, #FLOPS=389G, Crop Size=640x6402025.05 | 50 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerBackbone=Swin-L, Pretraining=ImageNet-22K, #Params=219M, #FLOPs=436G, #Queries=250, Crop Size=640x640, Iters=160k, Training Strategy=Joint Training2022.11 | 49.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X-Decoder (L)Type=Open-vocabulary, Backbone=Large2023.03 | 49.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MP-FormerBackbone=Swin-L, Pre-training=ImageNet-22K, Inference Scale=Single-scale2023.03 | 49.4 | 35.2 | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former-PanopticBackbone=Swin-L, Pretraining=ImageNet-22K, Confidence Threshold=0.5, #Params=216M, #FLOPs=413G, #Queries=200, Crop Size=640x640, Iters=160k, Training Strategy=Individual Training2022.11 | 48.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| kMaX-DeepLabBackbone=ConvNeXt-L, Batch Size=64, #Params=232M, #FLOPs=333G, #Queries=256, Crop Size=641x641, Iters=100k, Training Strategy=Individual Training2022.11 | 48.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| kMaX-DeepLab (L)Type=Closed-set, Backbone=Large2023.03 | 48.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former-PanopticBackbone (Mask Generator)=Swin-L [32], #Params=216M, #FLOPS=413G, Crop Size=640x6402025.05 | 48.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormer (L)Type=Closed-set, Backbone=Large2023.03 | 48.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former (L)Type=Closed-set, Backbone=Large2023.03 | 48.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-L, Pre-training=ImageNet-22K, Inference Scale=Single-scale2023.03 | 48.1 | 34.2 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-L, Pre-training=IN21K, Params=216M, Input size=640x6402025.03 | 48.1 | — | — | — | — | 31 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (T)Type=Open-vocabulary, Backbone=Tiny2023.03 | 47.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EoMTBackbone=ViT-Large, Input Resolution=640 x 6402026.05 | 46.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 699.9 | 48.5 | 13.2 | |
| TokenMaskBackbone=ViT-Large, Input Resolution=640 x 6402026.05 | 45.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 501.5 | 61.9 | 15.3 | |
| FC-CLIPtraining_dataset=ADE20K2023.08 | 41.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.2 | — | — | 50.2 | — | — | — | — | — | |
| X-Decoder (T)Type=Open-vocabulary, Backbone=Tiny2023.03 | 41.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CleanBackbone=Swin-T2024.10 | 41.6 | 27.7 | 49.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MP-FormerBackbone=R50, Inference Scale=Single-scale2023.03 | 40.8 | 27.1 | 48.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EoMTBackbone=ViT-Base, Input Resolution=640 x 6402026.05 | 40.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 263.2 | 94.8 | 34.1 | |
| Mask2Former (T)Type=Closed-set, Backbone=Tiny2023.03 | 39.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=R50, Inference Scale=Single-scale2023.03 | 39.7 | 26.5 | 46.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=R50, Scale=640,2560, GPU=V1002023.03 | 39.7 | — | — | 39 | 40.9 | 11.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CleanBackbone=ResNet502024.10 | 39.7 | 26.5 | 46.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=ResNet-50, Input Resolution=640 x 6402026.05 | 39.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 147.2 | 0.6 | 7.1 | |
| TokenMaskBackbone=ViT-Base, Input Resolution=640 x 6402026.05 | 39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 146.3 | 131.6 | 42.9 | |
| YOSOBackbone=R50, Scale=640,2560, GPU=V1002023.03 | 38 | — | — | 37.3 | 39.4 | 35.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EoMTBackbone=ViT-Small, Input Resolution=640 x 6402026.05 | 38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.7 | 129.3 | 67.6 | |
| Panoptic-DeepLabBackbone=SWideRNet, Pre-training=ImageNet-22K, Inference Scale=Single-scale2023.03 | 37.9 | — | 50 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ARBackbone=ResNet502024.10 | 37.8 | 24.9 | 43.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PanSegFormerBackbone=R502023.03 | 36.4 | — | — | 35.3 | 38.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LiPSBackbone=AFFormer [5], Input Resolution=640 x 6402026.05 | 35.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 26.4 | 3.6 | 17.5 | |
| TokenMaskBackbone=ViT-Small, Input Resolution=640 x 6402026.05 | 35.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 37.3 | 150.8 | 103.9 | |
| MaskFormerBackbone=R50, Inference Scale=Single-scale2023.03 | 34.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskFormerBackbone=R50, Scale=640,25602023.03 | 34.7 | — | — | 32.2 | 39.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BGRNetBackbone=R50-FPN2023.03 | 31.8 | — | — | 34.1 | 27.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ODISEtraining_dataset=ADE20K2023.08 | 31.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.9 | — | — | 36.9 | — | — | — | — | — | |
| EoMTBackbone=ViT-Tiny, Input Resolution=640 x 6402026.05 | 29.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 20.8 | 189 | 143.9 | |
| PosSAMBackbone / Model Scale=Huge, Zero-shot protocol=true, Open-vocabulary setting=true, Training dataset=COCO2024.03 | 29.2 | — | — | — | — | — | — | — | — | — | — | — | 18.3 | 35.1 | 76.3 | — | — | 34.7 | — | — | — | — | — | |
| PosSAMTransfer=COCO -> ADE20K2024.03 | 29.2 | — | — | 28.3 | 30.9 | — | 39.5 | — | — | 21.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PosSAMBackbone / Model Scale=Large, Zero-shot protocol=true, Open-vocabulary setting=true, Training dataset=COCO2024.03 | 28 | — | — | — | — | — | — | — | — | — | — | — | 18.3 | 34.2 | 75.5 | — | — | 33.4 | — | — | — | — | — | |
| TokenMaskBackbone=ViT-Tiny, Input Resolution=640 x 6402026.05 | 27.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 9.7 | 202.9 | 211 | |
| MAFT+ensemble operation=false2024.08 | 27.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | 73.5 | — | — | 32.9 | — | — | — | — | — | |
| FCCLIPZero-shot protocol=true, Open-vocabulary setting=true, Training dataset=COCO2024.03 | 26.8 | — | — | — | — | — | — | — | — | — | — | — | 16.8 | 34.1 | 71.5 | — | — | 32.3 | — | — | — | — | — | |
| FCCLIPTransfer=COCO -> ADE20K2024.03 | 26.8 | — | — | 25.1 | 30.1 | — | 39.1 | — | — | 17.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-CLIP*ensemble operation=true2024.08 | 26.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.5 | — | — | 32.2 | — | — | — | — | — | |
| PosSAMBackbone / Model Scale=Base, Zero-shot protocol=true, Open-vocabulary setting=true, Training dataset=COCO2024.03 | 26.5 | — | — | — | — | — | — | — | — | — | — | — | 16.8 | 32.9 | 74.7 | — | — | 32 | — | — | — | — | — | |
| ODISElabel supervision=false, mask supervision=true, caption supervision=true2023.03 | 23.4 | — | — | — | — | — | — | — | — | — | — | — | 13.9 | 28.7 | — | — | — | — | — | — | — | — | — | |
| MaskQCLIPZero-shot protocol=true, Open-vocabulary setting=true, Training dataset=COCO2024.03 | 23.3 | — | — | — | — | — | — | — | — | — | — | — | — | 30.4 | — | — | — | — | — | — | — | — | — | |
| ODISEZero-shot protocol=true, Open-vocabulary setting=true, Training dataset=COCO2024.03 | 23.2 | — | — | — | — | — | — | — | — | — | — | — | 14 | 28.4 | 74.4 | — | — | 27.9 | — | — | — | — | — | |
| ODISEvariant=Caption, Transfer=COCO -> ADE20K2024.03 | 23.2 | — | — | 21.3 | 25.9 | — | 33.2 | — | — | 15.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ODISEvariant=Label, Transfer=COCO -> ADE20K2024.03 | 22.7 | — | — | 21.3 | 25.7 | — | 37.5 | — | — | 11.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ODISElabel supervision=true, mask supervision=true, caption supervision=false2023.03 | 22.6 | — | — | — | — | — | — | — | — | — | — | — | 14.4 | 29.9 | — | — | — | — | — | — | — | — | — | |
| ODISE2024.08 | 22.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-CLIPensemble operation=false2024.08 | 21.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.5 | — | — | 26.4 | — | — | — | — | — | |
| OPSNet2024.08 | 19 | — | — | — | — | — | — | — | — | — | — | — | — | — | 52.4 | — | — | 23 | — | — | — | — | — | |
| SynPerBackbone=ResNet502024.10 | 18.6 | 13.6 | 28.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OPSNetZero-shot protocol=true, Open-vocabulary setting=true, Training dataset=COCO2024.03 | 17.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 54.9 | — | — | 21.6 | — | — | — | — | — | |
| FreeSegZero-shot protocol=true, Open-vocabulary setting=true, Training dataset=COCO2024.03 | 16.3 | — | — | — | — | — | — | — | — | — | — | — | 6.5 | 24.6 | 71.8 | — | — | 21.6 | — | — | — | — | — | |
| FreeSeg2024.08 | 16.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskCLIPfull_model=true2022.08 | 15.121 | — | — | 13.536 | 18.29 | — | — | — | — | — | — | — | — | — | 70.479 | 70.021 | 71.396 | 19.211 | 17.448 | 22.737 | — | — | — | |
| MaskCLIPlabel supervision=true, mask supervision=true, caption supervision=false2023.03 | 15.1 | — | — | — | — | — | — | — | — | — | — | — | 6 | 23.7 | — | — | — | — | — | — | — | — | — | |
| MaskCLIPZero-shot protocol=true, Open-vocabulary setting=true, Training dataset=COCO2024.03 | 15.1 | — | — | — | — | — | — | — | — | — | — | — | 6 | 23.7 | — | — | — | 23.7 | — | — | — | — | — | |
| MaskCLIP2024.08 | 15.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.4 | — | — | 19.2 | — | — | — | — | — | |
| MaskCLIP (MaskRCNN)architecture=MaskRCNN2022.08 | 12.86 | — | — | 11.242 | 16.095 | — | — | — | — | — | — | — | — | — | 64.008 | 64.183 | 63.658 | 16.803 | 14.968 | 20.473 | — | — | — | |
| UnSegBackbone=ResNet502024.10 | 11.7 | 7.5 | 17.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CUDABackbone=ResNet502024.10 | 10.7 | 8.4 | 19.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskCLIP w/o RMARMA=false2022.08 | 9.565 | — | — | 8.922 | 10.852 | — | — | — | — | — | — | — | — | — | 62.507 | 62.268 | 62.985 | 12.645 | 11.758 | 14.418 | — | — | — | |
| CLIP Baselinetype=baseline2022.08 | 8.207 | — | — | 8.473 | 7.675 | — | — | — | — | — | — | — | — | — | 53.124 | 52.661 | 54.048 | 10.534 | 10.883 | 9.835 | — | — | — | |
| UnSegBackbone=Swin-T2024.10 | 4.1 | 3.4 | 10.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPSupervision=Open Vocabulary2023.03 | — | — | — | — | — | — | 9.5 | 62.8 | 12.1 | 3.4 | 61.1 | 4.7 | — | — | — | — | — | — | — | — | — | — | — |