Semantic Segmentation on PASCAL VOC 2b
83.3mIoULoGoSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| LoGoSegVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 83.3 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 82.5 | |
| LoGoSegVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 82.1 | |
| CAT-SegVLM=ViT-L/14, Feature backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 81.8 | |
| LoGoSegVLM=ViT-B/16, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 78.6 | |
| CAT-SegVLM=ViT-B/16, Feature backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 78.3 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 77.3 | |
| LoGoSegVLM=ConvNeXt-B, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 77.2 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2023.03 | 70.2 | |
| OpenSegVLM=ALIGN, Feature backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 70.2 | |
| ZegFormer†VLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 65.5 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=true2023.03 | 63.8 | |
| OpenSegVLM=ALIGN, Feature backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 63.8 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2023.03 | 62.7 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2026.02 | 62.7 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 59 |