Semantic Segmentation on Pascal VOC VOC-20 (test)
98.5mIoUDPSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| DPSegVLM=ConvNeXt-L, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 98.5 | |
| CAT-SegVLM=SILC-C-L/162023.10 | 97.6 | |
| DPSegVLM=ConvNeXt-L, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 97.4 | |
| SCANVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 97.2 | |
| CAT-SegVLM=CLIP-G/142023.10 | 97.1 | |
| SCANVLM=ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 97 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 96.9 | |
| CAT-SegVLM=CLIP-L/142023.10 | 96.6 | |
| CAT-SegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 96.6 | |
| EBSegVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 96.4 | |
| CAT-SegVLM=SILC-S-B/162023.10 | 96.1 | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2025.05 | 96.1 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 96 | |
| CAT-SegVLM=SILC-C-B/162023.10 | 95.9 | |
| SANVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 95.5 | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic [20]2025.05 | 95.4 | |
| EBSegVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 94.6 | |
| OVSegVLM=CLIP-L/142023.10 | 94.5 | |
| OVSegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 94.5 | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff2025.05 | 94.4 | |
| SANVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 94 | |
| CAT-SegVLM=CLIP-B/162023.10 | 93.7 | |
| CAT-SegVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 93.7 | |
| OVSegVLM=CLIP-B/162023.10 | 92.6 | |
| OVSegVLM=ViT-B/16, Backbone=ResNet-101c, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 92.6 | |
| ZSsegVLM=CLIP-L/142023.10 | 92.3 | |
| ZegFormerVLM=CLIP-B/162023.10 | 89.5 | |
| ZegFormerVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 89.5 | |
| ZSsegVLM=CLIP-B/162023.10 | 88.4 | |
| SimSegVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 88.4 | |
| Han et al.VLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO Panoptic [20]2025.05 | 83.2 | |
| PACLVLM=ViT-B/16, Training Dataset=GCC [41] + YFCC[45]2025.05 | 72.3 | |
| LSegVLM=ViT-B/32, Backbone=ViT-L/16, Training Dataset=PASCAL VOC-152025.05 | 52.3 | |
| LSegVLM=ViT-B/32, Backbone=ResNet-101, Training Dataset=PASCAL VOC-152025.05 | 47.4 |