Semantic Segmentation on A-847
19.9mIoUDiGSeg
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DiGSegVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 19.9 | — | — | |
| ESC-NetVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 18.1 | — | — | |
| DiGSegVLM=CLIP ViT-B/16, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 17.5 | — | — | |
| MaskCLIP++ w/ MAFT+CLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 16.8 | — | — | |
| DCP-CLIPVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 16.4 | — | — | |
| HyperCLIPVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 16.3 | — | — | |
| Mask-AdapterVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 16.2 | — | — | |
| OVSNetVLM=CLIP ViT-L/14, Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 16.2 | — | — | |
| CAT-SegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 16 | — | — | |
| CAT-SegVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 16 | — | — | |
| DPSegVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 15.7 | — | — | |
| MaskCLIP++ w/ FC-CLIPCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 15.4 | — | — | |
| MAFT+CLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 15.1 | — | — | |
| GBAVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 15.1 | — | — | |
| MAFT+VLM=ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 15.1 | — | — | |
| FC-CLIPCLIP arch.=ConvNeXt-L, Training dataset=COCO Panoptic2024.12 | 14.8 | — | — | |
| FC-CLIPVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 14.8 | — | — | |
| BBNVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 14.2 | — | — | |
| Mask-AdapterVLM=CLIP ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 14.2 | — | — | |
| SCANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 14 | — | — | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 14 | — | — | |
| SCANVLM=CLIP ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 14 | — | — | |
| SEDVLM=ConvNeXt-L, Training dataset=COCO-Stuff2026.03 | 13.9 | — | — | |
| SEDVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 13.9 | — | — | |
| SEDCLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 13.7 | — | — | |
| SANVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 13.7 | — | — | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 13.7 | — | — | |
| USEVLM=CLIP ViT-L/14, Additional Backbone=Swin-B,SAM [41], Training dataset=COCO-Stuff2026.03 | 13.4 | — | — | |
| ESC-NetVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 13.3 | — | — | |
| DPSegVLM=CLIP ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 12.5 | — | — | |
| CLIPSelfCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 12.4 | — | — | |
| SANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 12.4 | — | — | |
| SANVLM=CLIP ViT-L/14, Backbone=Side Adapter, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 12.4 | — | — | |
| DCP-CLIPVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 12.3 | — | — | |
| HyperCLIPVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 12.3 | — | — | |
| CAT-SegVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 12 | — | — | |
| SEDVLM=ConvNeXt-B, Training dataset=COCO-Stuff2026.03 | 11.4 | — | — | |
| SEDVLM=ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 11.4 | — | — | |
| ODISECLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 11.1 | — | — | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 11.1 | — | — | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training dataset=COCO Panoptic [54]2026.03 | 11.1 | — | — | |
| EBSegVLM=CLIP ViT-B/16, Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 11.1 | — | — | |
| ODISEVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Panoptic, Additional Dataset=No2026.04 | 11 | — | — | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 10.8 | — | — | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 10.8 | — | — | |
| SCANVLM=CLIP ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 10.8 | — | — | |
| MasQCLIPCLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 10.7 | — | — | |
| SANVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 10.1 | — | — | |
| HIPIEBackbone=ViT-H2023.07 | 9.7 | — | — | |
| CELVLM=CLIP R50, Training dataset=COCO-Stuff2026.03 | 9.7 | — | — | |
| OVSegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 9 | — | — | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff+COCO Caption2026.03 | 9 | — | — | |
| OVSegVLM=CLIP ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.04 | 9 | — | — | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7 [60], Training dataset=COCO Panoptic [54]+LOc. Narr. [55]2026.03 | 8.8 | — | — | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 8.4 | — | — | |
| MaskCLIPCLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 8.2 | — | — | |
| DeOPVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff-1562026.03 | 7.1 | — | — | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff+COCO Caption2026.03 | 7.1 | — | — | |
| OVSegVLM=CLIP ViT-B/16, Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.04 | 7.1 | — | — | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 7 | — | — | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff-1562026.03 | 4.9 | — | — | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training dataset=COCO Panoptic [54]+LOc. Narr. [55]2026.03 | 4.4 | — | — | |
| GroupViTVLM=ViT-S/16, Training dataset=GCC [50] +YFCC [51]2026.03 | 4.3 | — | — | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 2.5 | — | — | |
| CAT-Seg2026.03 | — | 38.67 | 13.8 | |
| dinov3.seg2026.03 | — | 43.07 | 17.99 | |
| MAFT+2026.03 | — | 38.11 | 13.4 | |
| SED2026.03 | — | 31.67 | 12.23 |