Semantic Segmentation on PASCAL-Context 59 class (val)
64.7mIoUDiSa
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DiSaVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 64.7 | — | — | — | |
| X-DecoderBackbone=DaViT-L2023.12 | 64 | — | — | — | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 63.3 | — | — | — | |
| DPSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 62 | — | — | — | |
| SEDVLM=ConvNeXt-L, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 60.6 | — | — | — | |
| SANtraining dataset=COCO Stuff [5]2023.08 | 60.2 | — | — | — | |
| SAN2024.03 | 60.2 | — | — | — | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 60.2 | — | — | — | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 60.2 | — | — | — | |
| HIPIEBackbone=ViT-H2023.07 | 59.3 | — | — | — | |
| DiSaVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 59.3 | — | — | — | |
| SCANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 59.3 | — | — | — | |
| APE (C)Backbone=ViT-L2023.12 | 58.6 | — | — | — | |
| APE (D)Backbone=ViT-L2023.12 | 58.5 | — | — | — | |
| FC-CLIPtraining dataset=COCO Panoptic2023.08 | 58.4 | — | — | — | |
| APE (B)Backbone=ViT-L2023.12 | 58.3 | — | — | — | |
| DPSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 58.1 | — | — | — | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 57.7 | — | — | — | |
| SANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 57.7 | — | — | — | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 57.5 | — | — | — | |
| ODISEtraining dataset=COCO Panoptic2023.08 | 57.3 | — | — | — | |
| ODISE2023.07 | 57.3 | — | — | — | |
| ODISE2024.03 | 57.3 | — | — | — | |
| ODISEVLM=SD+CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.06 | 57.3 | — | — | — | |
| SEDVLM=ConvNeXt-B, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 57.3 | — | — | — | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 57.3 | — | — | — | |
| PSALMzero-shot=true, additional_training_data=LVIS2024.03 | 57.2 | — | — | — | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 56.7 | — | — | — | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 56.7 | — | — | — | |
| AttrSegTraining Data=COCO-Stuff, Backbone=RN101, Textual Input Setting=attributes2023.08 | 56.3 | — | — | — | |
| OVSegtraining dataset=COCO Stuff [5]2023.08 | 55.7 | — | — | — | |
| OVSegBackbone=Swin-B2023.12 | 55.7 | — | — | — | |
| OVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 55.7 | — | — | — | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 55.7 | — | — | — | |
| ODISEtraining dataset=COCO Panoptic + COCO Caption, variant=caption2023.08 | 55.3 | — | — | — | |
| CPNet101backbone=ResNet-101, multi-scale and flipped testing=true2020.04 | 53.9 | — | — | — | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 53.8 | — | — | — | |
| SANCategory=Open-vocabulary segmentation (OVS), Source=COCO-1712024.03 | 53.8 | — | — | — | |
| SANVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 53.8 | — | — | — | |
| HIPIEBackbone=RN502023.07 | 53.6 | — | — | — | |
| CAT-SegTraining Data=COCO-Stuff, Backbone=RN101, Textual Input Setting=attributes2023.08 | 53.6 | — | — | — | |
| OTSeg+Category=Zero-shot segmentation (ZS3), Source=COCO-1562024.03 | 53.4 | — | — | — | |
| OVSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff+COCO Caption[4]2024.06 | 53.3 | — | — | — | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 53.3 | — | — | — | |
| OTSegCategory=Zero-shot segmentation (ZS3), Source=COCO-1562024.03 | 52.9 | — | — | — | |
| ANLbackbone=ResNet-1012020.04 | 52.8 | — | — | — | |
| DANetbackbone=ResNet-101, multi-scale and flipped testing=true2020.04 | 52.6 | — | — | — | |
| SimSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 52.2 | — | — | — | |
| SimSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 51.9 | — | — | — | |
| EncNetbackbone=ResNet-101, multi-scale and flipped testing=true2020.04 | 51.7 | — | — | — | |
| CCLbackbone=ResNet-101, multi-scale and flipped testing=true2020.04 | 51.6 | — | — | — | |
| APE (A)Backbone=ViT-L2023.12 | 51.2 | — | — | — | |
| OVSegTraining Data=COCO-Stuff, Backbone=RN101, Textual Input Setting=attributes2023.08 | 51.2 | — | — | — | |
| DeOPBackbone=R101c, Training dataset=COCO-Stuff-156, Decoupled network=true, Number of Passes=12023.04 | 48.8 | — | — | — | |
| PSALMzero-shot=true2024.03 | 48.5 | — | — | — | |
| OpenSegBackbone=ENB72023.12 | 48.2 | — | — | — | |
| OpenSegVLM=ALIGN EN-B7, Training Dataset=COCO Panoptic[15]+Loc.Narr.2024.06 | 48.2 | — | — | — | |
| PSPNetbackbone=ResNet-101, multi-scale and flipped testing=true2020.04 | 47.8 | — | — | — | |
| SimBaseBackbone=R101c, Training dataset=COCO-Stuff-156, Decoupled network=true, Number of Passes=N'2023.04 | 47.7 | — | — | — | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 47.7 | — | — | — | |
| SimSegCOCO Training Data=Masks + Labels2022.08 | 47.7 | — | — | — | |
| RefineNetbackbone=ResNet-152, multi-scale and flipped testing=true2020.04 | 47.3 | — | — | — | |
| LSeg+training dataset=COCO Stuff [5]2023.08 | 46.5 | — | — | — | |
| LSeg+Backbone=RN502023.07 | 46.5 | — | — | — | |
| LSeg+VLM=ALIGN EN-B7, Training Dataset=COCO-Stuff2024.06 | 46.5 | — | — | — | |
| LSeg+COCO Training Data=Masks + Labels2022.08 | 46.5 | — | — | — | |
| MaskCLIPtraining dataset=COCO Panoptic2023.08 | 45.9 | — | — | — | |
| MaskCLIP2023.07 | 45.9 | — | — | — | |
| MaskCLIP2024.03 | 45.9 | — | — | — | |
| MaskCLIPVLM=CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.06 | 45.9 | — | — | — | |
| MaskCLIPCOCO Training Data=Masks + Labels2022.08 | 45.9 | — | — | — | |
| Deeplabv2backbone=ResNet101, extra dataset=true, multi-scale and flipped testing=true2020.04 | 45.7 | — | — | — | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 45.5 | — | — | — | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 45.5 | — | — | — | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=Yes2026.01 | 44.8 | — | — | — | |
| FreeDaSupporting Dataset=COCO Captions, Extra-Training=false, Fair=false2024.11 | 43.1 | — | — | — | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=No2026.01 | 42.8 | — | — | — | |
| OpenSegtraining dataset=COCO Panoptic + COCO Caption2023.08 | 42.1 | — | — | — | |
| OpenSeg2023.07 | 42.1 | — | — | — | |
| OpenSegCOCO Training Data=Masks + Captions2022.08 | 42.1 | — | — | — | |
| MaskCLIP (MaskRCNN)COCO Training Data=Masks + Labels2022.08 | 41.3 | — | — | — | |
| ZegCLIPVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff-156, Additional Dataset=Yes2026.01 | 41.2 | — | — | — | |
| BoxSupbackbone=VGG162020.04 | 40.5 | — | — | — | |
| CASSSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 40.2 | — | — | — | |
| OpenSegBackbone=R101, Training dataset=COCO + Loc. Narr., Decoupled network=false, Number of Passes=12023.04 | 40.1 | — | — | — | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=Yes2026.01 | 40.1 | — | — | — | |
| CRF-RNNbackbone=VGG162020.04 | 39.3 | — | — | — | |
| FCN-8sArchitecture=8-pixel stride (skip)2016.05 | 39.1 | 67.5 | 52.3 | 53 | |
| ZegformerTraining Data=COCO-Stuff, Backbone=RN101, Textual Input Setting=attributes2023.08 | 39 | — | — | — | |
| ProxyCLIPSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 38.8 | — | — | — | |
| FCN-16sArchitecture=16-pixel stride (skip)2016.05 | 38.4 | 66.9 | 51.3 | 52.3 | |
| FCN-8Sbackbone=VGG162020.04 | 37.8 | — | — | — | |
| OpenSegBackbone=R101, Training dataset=COCO, Decoupled network=false, Number of Passes=12023.04 | 36.9 | — | — | — | |
| OpenSegVLM=ALIGN RN-101, Training Dataset=COCO Panoptic[15]2024.06 | 36.9 | — | — | — | |
| FCN-32sArchitecture=32-pixel stride2016.05 | 36.7 | 65.5 | 49.1 | 50.9 | |
| LSeg+VLM=ALIGN RN-101, Training Dataset=COCO-Stuff2024.06 | 36 | — | — | — | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 36 | — | — | — | |
| CLIP-DINOiserSupporting Dataset=ImageNet1k, Extra-Training=true, Fair=false2024.11 | 35.9 | — | — | — | |
| ClearCLIPSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 35.9 | — | — | — | |
| NACLIPSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 35.2 | — | — | — |