Semantic Segmentation on PAS-20
97.3mIoUDCP-CLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| DCP-CLIPVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 97.3 | |
| SCANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 97.2 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 97.2 | |
| CAT-SegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 97 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 97 | |
| MaskCLIP++ w/ MAFT+CLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 96.8 | |
| BBNVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 96.8 | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 96.6 | |
| MAFT+CLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 96.5 | |
| MaskCLIP++ w/ FC-CLIPCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 96.4 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 96.4 | |
| SEDCLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 96.1 | |
| SEDVLM=ConvNeXt-L, Training dataset=COCO-Stuff2026.03 | 96.1 | |
| DCP-CLIPVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 95.9 | |
| GBAVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 95.8 | |
| SANVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 95.5 | |
| FC-CLIPCLIP arch.=ConvNeXt-L, Training dataset=COCO Panoptic2024.12 | 95.4 | |
| FC-CLIPVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 95.4 | |
| SANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 94.6 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 94.6 | |
| OVSegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 94.5 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff+COCO Caption2026.03 | 94.5 | |
| SEDVLM=ConvNeXt-B, Training dataset=COCO-Stuff2026.03 | 94.4 | |
| SANVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 94 | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 93.7 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff+COCO Caption2026.03 | 92.6 | |
| CELVLM=CLIP R50, Training dataset=COCO-Stuff2026.03 | 91.8 | |
| DeOPVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff-1562026.03 | 91.7 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 88.4 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff-1562026.03 | 86.2 | |
| PACLVLM=CLIP ViT-B/16, Training dataset=GCC [50]+YFCC [51]2026.03 | 72.3 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7 [60], Training dataset=COCO Panoptic [54]+LOc. Narr. [55]2026.03 | 72.2 | |
| LSegVLM=CLIP ViT-B/32, Additional Backbone=ViT-L/16, Training dataset=PASCAL VOC-152026.03 | 52.3 | |
| GroupViTVLM=ViT-S/16, Training dataset=GCC [50] +YFCC [51]2026.03 | 50.7 | |
| LSegVLM=CLIP ViT-B/32, Additional Backbone=ResNet-101, Training dataset=PASCAL VOC-152026.03 | 47.4 | |
| ZS3NetAdditional Backbone=ResNet-101, Training dataset=PASCAL VOC2026.03 | 38.3 | |
| SPNetAdditional Backbone=ResNet-101, Training dataset=PASCAL VOC2026.03 | 18.3 |