Open-vocabulary semantic segmentation on Pascal Context-459 (test)
22.6mIoUSED
Evaluation Results
| Method | Links | |
|---|---|---|
| SEDVLM=ConvNeXt-L, Training dataset=COCO-Stuff2023.11 | 22.6 | |
| CAT-SegVLM=ViT-L/14, Feature backbone=Swin-B, Training dataset=COCO-Stuff2023.11 | 20.4 | |
| SEDVLM=ConvNeXt-B, Training dataset=COCO-Stuff2023.11 | 18.6 | |
| FC-CLIPVLM=ConvNeXt-L, Training dataset=COCO Panoptic [26]2023.11 | 18.2 | |
| SANVLM=ViT-L/14, Training dataset=COCO-Stuff2023.11 | 17.1 | |
| CAT-SegVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 16.6 | |
| ODISEVLM=ViT-L/14, Training dataset=COCO Panoptic [26]2023.11 | 14.5 | |
| SANVLM=ViT-B/16, Training dataset=COCO-Stuff2023.11 | 12.6 | |
| OVSegVLM=ViT-L/14, Feature backbone=Swin-B, Training dataset=COCO-Stuff+COCO Caption2023.11 | 12.4 | |
| OpenSegVLM=ALIGN, Feature backbone=Eff-B7 [43], Training dataset=COCO Panoptic [26]+Loc. Narr. [36]2023.11 | 11.5 | |
| OVSegVLM=ViT-B/16, Feature backbone=ResNet-101c, Training dataset=COCO-Stuff+COCO Caption2023.11 | 11 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 10.4 | |
| Ding et al.VLM=ViT-L/14, Training dataset=COCO Panoptic [26]2023.11 | 10 | |
| DeOPVLM=ViT-B/16, Feature backbone=ResNet-101c, Training dataset=COCO-Stuff-1562023.11 | 9.4 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff-1562023.11 | 9.1 | |
| OpenSegVLM=ALIGN, Feature backbone=ResNet-101, Training dataset=COCO Panoptic [26]+Loc. Narr. [36]2023.11 | 7.9 | |
| Han et al.VLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO Panoptic [26]2023.11 | 7.1 | |
| LSeg+VLM=ALIGN, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 5.2 | |
| GroupViTVLM=ViT-S/16, Training dataset=GCC [40]+YFCC [44]2023.11 | 4.9 |