Semantic Segmentation on PC-459
29.2mIoUDiGSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| DiGSegVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 29.2 | |
| ESC-NetVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 27 | |
| DCP-CLIPVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 24.3 | |
| HyperCLIPVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 24.1 | |
| DPSegVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 24.1 | |
| MaskCLIP++ w/ MAFT+CLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 23.9 | |
| CAT-SegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 23.8 | |
| CAT-SegVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 23.8 | |
| BBNVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 23.5 | |
| OVSNetVLM=CLIP ViT-L/14, Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 23.5 | |
| DiGSegVLM=CLIP ViT-B/16, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 23.1 | |
| Mask-AdapterVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 22.7 | |
| SEDVLM=ConvNeXt-L, Training dataset=COCO-Stuff2026.03 | 22.6 | |
| SEDVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 22.6 | |
| SEDCLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 22.1 | |
| APE-D2025.11 | 21.8 | |
| MAFT+CLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 21.6 | |
| MAFT+VLM=ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 21.6 | |
| MaskCLIP++ w/ FC-CLIPCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 21.3 | |
| ESC-NetVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 21.1 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 21 | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 20.4 | |
| DPSegVLM=CLIP ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 20.1 | |
| DCP-CLIPVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 19.7 | |
| HyperCLIPVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 19.2 | |
| CAT-SegVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 19 | |
| SAM 32025.11 | 18.8 | |
| SEDVLM=ConvNeXt-B, Training dataset=COCO-Stuff2026.03 | 18.6 | |
| SEDVLM=ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 18.6 | |
| GBAVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 18.5 | |
| MasQCLIPSupervision Type=Fully-supervised, Annotation=true2024.08 | 18.2 | |
| MasQCLIPCLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 18.2 | |
| FC-CLIPCLIP arch.=ConvNeXt-L, Training dataset=COCO Panoptic2024.12 | 18.2 | |
| FC-CLIPVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 18.2 | |
| Mask-AdapterVLM=CLIP ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 17.9 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 17.3 | |
| EBSegVLM=CLIP ViT-B/16, Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 17.3 | |
| SANVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 17.1 | |
| SANVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 17.1 | |
| SCANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 16.7 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 16.7 | |
| SCANVLM=CLIP ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 16.7 | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 16.6 | |
| X-DecoderSupervision Type=Fully-supervised, Annotation=true2024.08 | 16.1 | |
| SANVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=no2023.02 | 15.7 | |
| SANSupervision Type=Fully-supervised, Annotation=true2024.08 | 15.7 | |
| MAFTSupervision Type=Fully-supervised, Annotation=true2024.08 | 15.7 | |
| SANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 15.7 | |
| SANVLM=CLIP ViT-L/14, Backbone=Side Adapter, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 15.7 | |
| USEVLM=CLIP ViT-L/14, Additional Backbone=Swin-B,SAM [41], Training dataset=COCO-Stuff2026.03 | 15 | |
| ODISESupervision Type=Fully-supervised, Annotation=true2024.08 | 14.5 | |
| ODISECLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 14.5 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training dataset=COCO Panoptic [54]2026.03 | 14.5 | |
| HIPIESupervision Type=Fully-supervised, Annotation=true2024.08 | 14.4 | |
| ODISEVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Panoptic, Additional Dataset=No2026.04 | 13.8 | |
| SANVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 13.7 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 13.2 | |
| SCANVLM=CLIP ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 13.2 | |
| SANVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=no2023.02 | 12.6 | |
| SANVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 12.6 | |
| CELVLM=CLIP R50, Training dataset=COCO-Stuff2026.03 | 12.6 | |
| OvSegVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 12.4 | |
| OVSegSupervision Type=Fully-supervised, Annotation=true2024.08 | 12.4 | |
| OVSegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 12.4 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff+COCO Caption2026.03 | 12.4 | |
| OVSegVLM=CLIP ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.04 | 12.4 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO+Loc. Narr., ensemble=no2023.02 | 12.2 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7 [60], Training dataset=COCO Panoptic [54]+LOc. Narr. [55]2026.03 | 12.2 | |
| OvSegVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 11 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff+COCO Caption2026.03 | 11 | |
| OVSegVLM=CLIP ViT-B/16, Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.04 | 11 | |
| SimSeg (reproduced)VL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 10.2 | |
| MaskCLIPVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=no2023.02 | 10 | |
| MaskCLIPSupervision Type=Fully-supervised, Annotation=true2024.08 | 10 | |
| MaskCLIPCLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 10 | |
| ProxyCLIPSupervision Type=Training-free, Annotation=false2024.08 | 9.9 | |
| SimSeg (reproduced)VL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 9.7 | |
| DeOPSupervision Type=Fully-supervised, Annotation=true2024.08 | 9.4 | |
| DeOPVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff-1562026.03 | 9.4 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff-1562026.03 | 9.1 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO, ensemble=no2023.02 | 9 | |
| SimSegVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 8.7 | |
| CLIP-DINOiserSupervision Type=Weakly-supervised, Annotation=false2024.08 | 8.4 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training dataset=COCO Panoptic [54]+LOc. Narr. [55]2026.03 | 7.9 | |
| LSeg+VL-Model=ALIGN EN-B7, Training Dataset=COCO, ensemble=no2023.02 | 7.8 | |
| GKCSupervision Type=Fully-supervised, Annotation=true2024.08 | 7.1 | |
| OpenSegVL-Model=ALIGN RN101, Training Dataset=COCO, ensemble=no2023.02 | 6.5 | |
| SCLIPSupervision Type=Training-free, Annotation=false2024.08 | 6.3 | |
| TCLSupervision Type=Weakly-supervised, Annotation=false2024.08 | 5.3 | |
| LSeg+VL-Model=ALIGN RN101, Training Dataset=COCO, ensemble=no2023.02 | 5.2 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 5.2 | |
| GroupViTVLM=ViT-S/16, Training dataset=GCC [50] +YFCC [51]2026.03 | 4.9 | |
| MaskCLIPSupervision Type=Training-free, Annotation=false2024.08 | 4.6 | |
| CLIPSupervision Type=Training-free, Annotation=false2024.08 | 1.3 |