Open-Vocabulary Semantic Segmentation on ADE-847
18.1mIoUESC-Net
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ESC-NetVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 18.1 | — | |
| MAFTP w/ MaskAdapterVLM=CLIP ConvNeXt-L, Training Dataset=COCO-Stuff2024.12 | 16.2 | — | |
| SMARTVLM=CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.12 | 16.1 | — | |
| MROVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 16.1 | — | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 16 | — | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 16 | — | |
| MAFTPVLM=CLIP ConvNeXt-L, Training Dataset=COCO-Stuff2024.12 | 15.5 | — | |
| GBAVLM=CLIP ConvNeXt-L, Training Dataset=COCO Panoptic2024.12 | 15.1 | — | |
| MAFT+VLM=ConvNeXt-L, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 15.1 | — | |
| FC-CLIPVLM=CLIP ConvNeXt-L, Training Dataset=COCO Panoptic2024.12 | 14.8 | — | |
| MAFTP w/ MaskAdapterVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2024.12 | 14.2 | — | |
| FC-CLIP w/ MaskAdapterVLM=CLIP ConvNeXt-L, Training Dataset=COCO Panoptic2024.12 | 14.1 | — | |
| SCAN2023.12 | 14 | 14.6 | |
| SCANVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 14 | — | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 13.9 | — | |
| CAT-SegPrompt Tuning=MMRL+VaMP2025.11 | 13.9 | — | |
| MAFTPVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2024.12 | 13.8 | — | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 13.7 | — | |
| SEDVLM=CLIP ConvNeXt-L, Training Dataset=COCO-Stuff2024.12 | 13.7 | — | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 13.7 | — | |
| USEVLM=CLIP ViT-L/14, Additional Backbone=DINOv2, SAM, Training Dataset=COCO-Stuff, Additional Dataset=true2024.11 | 13.4 | — | |
| ESC-NetVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 13.3 | — | |
| CAT-SegPrompt Tuning=MMRL2025.11 | 12.8 | — | |
| MAFTVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 12.7 | — | |
| SAN2023.12 | 12.4 | 13.2 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 12.4 | — | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 12.4 | — | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 12 | — | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 12 | — | |
| CAT-SegPrompt Tuning=-2025.11 | 12 | — | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 11.7 | — | |
| SEDVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2024.12 | 11.4 | — | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 11.4 | — | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic, Additional Dataset=false2024.11 | 11.2 | — | |
| ODISEVLM=Stable Diffusion, Training Dataset=COCO Panoptic2024.12 | 11.1 | — | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 11.1 | — | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 11.1 | — | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 10.8 | — | |
| MAFT2023.12 | 10.1 | 11.5 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 10.1 | — | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 10.1 | — | |
| SANPrompt Tuning=-2025.11 | 10.1 | — | |
| OVSeg2023.12 | 9 | 9.5 | |
| OvSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 9 | — | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=true2024.11 | 9 | — | |
| OpenSegVLM=ALIGN, Training Dataset=COCO Panoptic+Loc. Narr.2024.12 | 8.8 | — | |
| OpenSegVLM=ALIGN, Additional Backbone=EfficientNet-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2024.11 | 8.1 | — | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 7.1 | — | |
| OvSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 7.1 | — | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=true2024.11 | 7.1 | — | |
| DeOPVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training Dataset=COCO-Stuff-156, Additional Dataset=false2024.11 | 7.1 | — | |
| OVSegPrompt Tuning=-2025.11 | 7.1 | — | |
| SimSeg2023.12 | 7 | 8.1 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 7 | — | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 5.6 | — | |
| ZegFormerPrompt Tuning=-2025.11 | 5.6 | — | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2024.11 | 4.9 | — | |
| CoM-PTBackbone=ViT-L/16, PT Method=CoM-PT, Fine-tuning Protocol=SAN [70]2026.04 | 4.73 | — | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=true2024.11 | 4.4 | — | |
| CoM-PTBackbone=ViT-B/16, PT Method=CoM-PT, Fine-tuning Protocol=SAN [70]2026.04 | 3.18 | — | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 2.5 | — | |
| BaselineBackbone=ViT-L/16, PT Method=Baseline, Fine-tuning Protocol=SAN [70]2026.04 | 1.03 | — | |
| BaselineBackbone=ViT-B/16, PT Method=Baseline, Fine-tuning Protocol=SAN [70]2026.04 | 0.45 | — |