Open-vocabulary Semantic Segmentation on ADE20K-847 (test)
14.8mIoUFC-CLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| FC-CLIPVLM=ConvNeXt-L, Training dataset=COCO Panoptic [26]2023.11 | 14.8 | |
| SEDVLM=ConvNeXt-L, Training dataset=COCO-Stuff2023.11 | 13.9 | |
| SANVLM=ViT-L/14, Training dataset=COCO-Stuff2023.11 | 13.7 | |
| SEDVLM=ConvNeXt-B, Training dataset=COCO-Stuff2023.11 | 11.4 | |
| ODISEVLM=ViT-L/14, Training dataset=COCO Panoptic [26]2023.11 | 11.1 | |
| CAT-SegVLM=ViT-L/14, Feature backbone=Swin-B, Training dataset=COCO-Stuff2023.11 | 10.8 | |
| SANVLM=ViT-B/16, Training dataset=COCO-Stuff2023.11 | 10.1 | |
| OVSegVLM=ViT-L/14, Feature backbone=Swin-B, Training dataset=COCO-Stuff+COCO Caption2023.11 | 9 | |
| CAT-SegVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 8.4 | |
| Ding et al.VLM=ViT-L/14, Training dataset=COCO Panoptic [26]2023.11 | 8.2 | |
| OpenSegVLM=ALIGN, Feature backbone=Eff-B7 [43], Training dataset=COCO Panoptic [26]+Loc. Narr. [36]2023.11 | 8.1 | |
| DeOPVLM=ViT-B/16, Feature backbone=ResNet-101c, Training dataset=COCO-Stuff-1562023.11 | 7.1 | |
| OVSegVLM=ViT-B/16, Feature backbone=ResNet-101c, Training dataset=COCO-Stuff+COCO Caption2023.11 | 7.1 | |
| SimBaselineVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 7 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 5.6 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff-1562023.11 | 4.9 | |
| OpenSegVLM=ALIGN, Feature backbone=ResNet-101, Training dataset=COCO Panoptic [26]+Loc. Narr. [36]2023.11 | 4.4 | |
| GroupViTVLM=ViT-S/16, Training dataset=GCC [40]+YFCC [44]2023.11 | 4.3 | |
| Han et al.VLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO Panoptic [26]2023.11 | 3.5 | |
| LSeg+VLM=ALIGN, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 2.5 |