Open-vocabulary semantic segmentation on Pascal Context-59 (test)
62mIoUCAT-Seg
Evaluation Results
| Method | Links | |
|---|---|---|
| CAT-SegVLM=ViT-L/14, Feature backbone=Swin-B, Training dataset=COCO-Stuff2023.11 | 62 | |
| SEDVLM=ConvNeXt-L, Training dataset=COCO-Stuff2023.11 | 60.6 | |
| SANVLM=ViT-L/14, Training dataset=COCO-Stuff2023.11 | 60.2 | |
| HIPIEVLM=BERT-B [12], Feature backbone=ViT-H, Training dataset=COCO Panoptic [26]2023.11 | 59.3 | |
| FC-CLIPVLM=ConvNeXt-L, Training dataset=COCO Panoptic [26]2023.11 | 58.4 | |
| CAT-SegVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 57.5 | |
| SEDVLM=ConvNeXt-B, Training dataset=COCO-Stuff2023.11 | 57.3 | |
| ODISEVLM=ViT-L/14, Training dataset=COCO Panoptic [26]2023.11 | 57.3 | |
| OVSegVLM=ViT-L/14, Feature backbone=Swin-B, Training dataset=COCO-Stuff+COCO Caption2023.11 | 55.7 | |
| SANVLM=ViT-B/16, Training dataset=COCO-Stuff2023.11 | 53.8 | |
| OVSegVLM=ViT-B/16, Feature backbone=ResNet-101c, Training dataset=COCO-Stuff+COCO Caption2023.11 | 53.3 | |
| PACLVLM=ViT-B/16, Training dataset=GCC [40]+YFCC [44]2023.11 | 50.1 | |
| DeOPVLM=ViT-B/16, Feature backbone=ResNet-101c, Training dataset=COCO-Stuff-1562023.11 | 48.8 | |
| SimBaselineVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 47.7 | |
| Ding et al.VLM=ViT-L/14, Training dataset=COCO Panoptic [26]2023.11 | 45.9 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 45.5 | |
| Han et al.VLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO Panoptic [26]2023.11 | 45.2 | |
| OpenSegVLM=ALIGN, Feature backbone=Eff-B7 [43], Training dataset=COCO Panoptic [26]+Loc. Narr. [36]2023.11 | 44.8 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff-1562023.11 | 42.8 | |
| OpenSegVLM=ALIGN, Feature backbone=ResNet-101, Training dataset=COCO Panoptic [26]+Loc. Narr. [36]2023.11 | 40.1 | |
| LSeg+VLM=ALIGN, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 36 | |
| GroupViTVLM=ViT-S/16, Training dataset=GCC [40]+YFCC [44]2023.11 | 25.9 | |
| SPNetFeature backbone=ResNet-101, Training dataset=PASCAL VOC2023.11 | 24.3 | |
| ZS3NetFeature backbone=ResNet-101, Training dataset=PASCAL VOC2023.11 | 19.4 |