Semantic Segmentation on PASCAL VOC PAS-20 foreground categories (val)
98.7mIoUDiSa
Evaluation Results
| Method | Links | |
|---|---|---|
| DiSaVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 98.7 | |
| DPSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 97.4 | |
| SCANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 97.2 | |
| DiSaVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 97 | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 97 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 96.4 | |
| SEDVLM=ConvNeXt-L, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 96.1 | |
| DPSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 96 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 94.6 | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 94.6 | |
| SANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 94.6 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 94.5 | |
| SEDVLM=ConvNeXt-B, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 94.4 | |
| SANVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 94 | |
| ZegCLIPVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff-156, Additional Dataset=Yes2026.01 | 93.6 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 92.6 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 89.5 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 88.4 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=No2026.01 | 86.2 | |
| LSegVLM=CLIP ViT-B/32, Additional Backbone=ViT-L/16, Training Dataset=PASCAL VOC-15, Additional Dataset=No2026.01 | 52.3 | |
| LSegVLM=CLIP ViT-B/32, Additional Backbone=ResNet-101, Training Dataset=PASCAL VOC-15, Additional Dataset=No2026.01 | 47.4 |