Open-vocabulary Semantic Segmentation on ADE20K 150 (test)
35.2mIoUSED
Evaluation Results
| Method | Links | |
|---|---|---|
| SEDVLM=ConvNeXt-L, Training dataset=COCO-Stuff2023.11 | 35.2 | |
| FC-CLIPVLM=ConvNeXt-L, Training dataset=COCO Panoptic [26]2023.11 | 34.1 | |
| SANVLM=ViT-L/14, Training dataset=COCO-Stuff2023.11 | 33.3 | |
| SEDVLM=ConvNeXt-B, Training dataset=COCO-Stuff2023.11 | 31.6 | |
| CAT-SegVLM=ViT-L/14, Feature backbone=Swin-B, Training dataset=COCO-Stuff2023.11 | 31.5 | |
| PACLVLM=ViT-B/16, Training dataset=GCC [40]+YFCC [44]2023.11 | 31.4 | |
| ODISEVLM=ViT-L/14, Training dataset=COCO Panoptic [26]2023.11 | 29.9 | |
| OVSegVLM=ViT-L/14, Feature backbone=Swin-B, Training dataset=COCO-Stuff+COCO Caption2023.11 | 29.6 | |
| HIPIEVLM=BERT-B [12], Feature backbone=ViT-H, Training dataset=COCO Panoptic [26]2023.11 | 29 | |
| SANVLM=ViT-B/16, Training dataset=COCO-Stuff2023.11 | 27.5 | |
| CAT-SegVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 27.2 | |
| OpenSegVLM=ALIGN, Feature backbone=Eff-B7 [43], Training dataset=COCO Panoptic [26]+Loc. Narr. [36]2023.11 | 26.4 | |
| OVSegVLM=ViT-B/16, Feature backbone=ResNet-101c, Training dataset=COCO-Stuff+COCO Caption2023.11 | 24.8 | |
| Ding et al.VLM=ViT-L/14, Training dataset=COCO Panoptic [26]2023.11 | 23.7 | |
| DeOPVLM=ViT-B/16, Feature backbone=ResNet-101c, Training dataset=COCO-Stuff-1562023.11 | 22.9 | |
| SimBaselineVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 20.5 | |
| Han et al.VLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO Panoptic [26]2023.11 | 18.8 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 18 | |
| OpenSegVLM=ALIGN, Feature backbone=ResNet-101, Training dataset=COCO Panoptic [26]+Loc. Narr. [36]2023.11 | 17.5 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training dataset=COCO-Stuff-1562023.11 | 16.9 | |
| LSeg+VLM=ALIGN, Feature backbone=ResNet-101, Training dataset=COCO-Stuff2023.11 | 13 | |
| GroupViTVLM=ViT-S/16, Training dataset=GCC [40]+YFCC [44]2023.11 | 10.6 |