Open-vocabulary Semantic Segmentation on PASCAL-VOC PAS-20b
86.3mIoUESC-Net
Evaluation Results
| Method | Links | |
|---|---|---|
| ESC-NetVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 86.3 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 82.5 | |
| ESC-NetVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 80.1 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 77.3 | |
| HyperCLIPVLM=CLIP ViT-B/16, Fine-tuning Space=H2026.05 | 77.1 | |
| HyRoVLM=CLIP ViT-B/16, Fine-tuning Space=H2026.05 | 76.7 | |
| OpenSegVLM=ALIGN, Additional Backbone=EfficientNet-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2024.11 | 70.2 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=true2024.11 | 63.8 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 63.8 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2024.11 | 62.7 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 62.7 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 59 |