Semantic Segmentation on A-150
43.2mIoUDiGSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| DiGSegVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 43.2 | |
| ESC-NetVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 41.8 | |
| MaskCLIP++ w/ MAFT+CLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 38.2 | |
| Mask-AdapterVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 38.2 | |
| HyperCLIPVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 38.2 | |
| DCP-CLIPVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 38.1 | |
| CAT-SegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 37.9 | |
| DiGSegVLM=CLIP ViT-B/16, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 37.2 | |
| MaskCLIP++ w/ FC-CLIPCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 37.1 | |
| USEVLM=CLIP ViT-L/14, Additional Backbone=Swin-B,SAM [41], Training dataset=COCO-Stuff2026.03 | 37.1 | |
| OVSNetVLM=CLIP ViT-L/14, Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 37.1 | |
| DPSegVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 37.1 | |
| SemLAVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 36.9 | |
| MAFT+CLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 36.1 | |
| MAFT+VLM=ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 36.1 | |
| GBAVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 35.9 | |
| ESC-NetVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 35.6 | |
| Mask-AdapterVLM=CLIP ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 35.6 | |
| SEDCLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 35.2 | |
| SEDVLM=ConvNeXt-L, Training dataset=COCO-Stuff2026.03 | 35.2 | |
| SEDVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 35.2 | |
| Seg4DiffVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 35.2 | |
| CLIPSelfCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 34.5 | |
| BBNVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 34.5 | |
| FC-CLIPCLIP arch.=ConvNeXt-L, Training dataset=COCO Panoptic2024.12 | 34.1 | |
| FC-CLIPVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 34.1 | |
| SCANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 33.5 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 33.5 | |
| SCANVLM=CLIP ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 33.5 | |
| SANVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 33.3 | |
| DPSegVLM=CLIP ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 33.3 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 32.8 | |
| DCP-CLIPVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 32.4 | |
| SANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 32.1 | |
| HyperCLIPVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 32.1 | |
| CAT-SegVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 31.8 | |
| SEDVLM=ConvNeXt-B, Training dataset=COCO-Stuff2026.03 | 31.6 | |
| SEDVLM=ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 31.6 | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 31.5 | |
| CAT-SegVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 31.5 | |
| PACLVLM=CLIP ViT-B/16, Training dataset=GCC [50]+YFCC [51]2026.03 | 31.4 | |
| OPMapperVLM=CLIP ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 31 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 30.8 | |
| SCANVLM=CLIP ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 30.8 | |
| MasQCLIPCLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 30.4 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 30 | |
| EBSegVLM=CLIP ViT-B/16, Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 30 | |
| ODISECLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 29.9 | |
| CELVLM=CLIP R50, Training dataset=COCO-Stuff2026.03 | 29.9 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training dataset=COCO Panoptic [54]2026.03 | 29.9 | |
| SANVLM=CLIP ViT-L/14, Backbone=Side Adapter, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 29.9 | |
| OVSegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 29.6 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff+COCO Caption2026.03 | 29.6 | |
| OVSegVLM=CLIP ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.04 | 29.6 | |
| ODISEVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Panoptic, Additional Dataset=No2026.04 | 28.7 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7 [60], Training dataset=COCO Panoptic [54]+LOc. Narr. [55]2026.03 | 28.6 | |
| SANVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 27.5 | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 27.2 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff+COCO Caption2026.03 | 24.8 | |
| OVSegVLM=CLIP ViT-B/16, Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.04 | 24.8 | |
| MaskCLIPCLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 23.7 | |
| DeOPVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff-1562026.03 | 22.9 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 20.5 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training dataset=COCO Panoptic [54]+LOc. Narr. [55]2026.03 | 17.5 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff-1562026.03 | 16.9 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 13 | |
| GroupViTVLM=ViT-S/16, Training dataset=GCC [50] +YFCC [51]2026.03 | 10.6 |