Semantic Segmentation on ADE20K-150 (test)
37.1mIoUDPSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| DPSegVLM=ConvNeXt-L, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 37.1 | |
| USE+SAMVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 37 | |
| DPSegVLM=ConvNeXt-L, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 36.4 | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2025.05 | 35.2 | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic [20]2025.05 | 34.1 | |
| SCANVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 33.5 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 33.3 | |
| SANVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 33.3 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 32.9 | |
| EBSegVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 32.8 | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff2025.05 | 31.6 | |
| CAT-SegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 31.5 | |
| PACLVLM=ViT-B/16, Training Dataset=GCC [41] + YFCC[45]2025.05 | 31.4 | |
| SCANVLM=ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 30.8 | |
| EBSegVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 30 | |
| ODISEVLM=ViT-L/14, Training Dataset=COCO Panoptic [20]2025.05 | 29.9 | |
| OVSegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 29.6 | |
| HIPIEVLM=BERT-B, Backbone=ViT-H, Training Dataset=COCO Panoptic [20]2025.05 | 29 | |
| SANVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 27.5 | |
| CAT-SegVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 27.2 | |
| OpenSegVLM=ALIGN, Backbone=Eff-B7 [44], Training Dataset=COCO Panoptic [20] + Loc. Narr. [36]2025.05 | 26.4 | |
| OVSegVLM=ViT-B/16, Backbone=ResNet-101c, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 24.8 | |
| Ding et al.VLM=ViT-L/14, Training Dataset=COCO Panoptic [20]2025.05 | 23.7 | |
| SimSegVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 20.5 | |
| ZS3NetBackbone=ResNet-101, Training Dataset=PASCAL VOC2025.05 | 19.4 | |
| Han et al.VLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO Panoptic [20]2025.05 | 18.8 | |
| ZegFormerVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 18 | |
| OpenSegVLM=ALIGN, Backbone=ResNet-101, Training Dataset=COCO Panoptic [20] + Loc. Narr. [36]2025.05 | 17.5 | |
| LSeg+VLM=ALIGN RN-101, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 13 |