Open-vocabulary Semantic Segmentation on PASCAL-Context PC-459
27mIoUESC-Net
Evaluation Results
| Method | Links | |
|---|---|---|
| ESC-NetVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 27 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 23.8 | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 22.6 | |
| MAFT+VLM=ConvNeXt-L, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 21.6 | |
| ESC-NetVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 21.1 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 21 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 19 | |
| HyRoVLM=CLIP ViT-B/16, Fine-tuning Space=H2026.05 | 18.9 | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 18.6 | |
| SEDVLM=CLIP ConvNeXt-B, Fine-tuning Space=E2026.05 | 18.6 | |
| HyperCLIPVLM=CLIP ViT-B/16, Fine-tuning Space=H2026.05 | 18.2 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 17.3 | |
| SCANVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 16.7 | |
| MAFTVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 16.2 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 15.7 | |
| USEVLM=CLIP ViT-L/14, Additional Backbone=DINOv2, SAM, Training Dataset=COCO-Stuff, Additional Dataset=true2024.11 | 15 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 14.5 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 13.2 | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic, Additional Dataset=false2024.11 | 12.7 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 12.6 | |
| SANVLM=CLIP ViT-B/16, Additional Backbone=Side Adapter, Fine-tuning Space=E2026.05 | 12.6 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=true2024.11 | 12.4 | |
| OpenSegVLM=ALIGN, Additional Backbone=EfficientNet-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2024.11 | 11.5 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=true2024.11 | 11 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Fine-tuning Space=E2026.05 | 11 | |
| DeOPVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training Dataset=COCO-Stuff-156, Additional Dataset=false2024.11 | 9.4 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2024.11 | 9.1 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 9.1 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=true2024.11 | 7.9 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 7.9 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 5.2 |