Semantic Segmentation on ADE-20k A-847 (test)
15.7mIoUDPSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| DPSegVLM=ConvNeXt-L, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 15.7 | |
| CAT-SegVLM=SILC-C-L/162023.10 | 15 | |
| DPSegVLM=ConvNeXt-L, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 14.9 | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic [20]2025.05 | 14.8 | |
| SCANVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 14 | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2025.05 | 13.9 | |
| SANVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 13.7 | |
| EBSegVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 13.7 | |
| CAT-SegVLM=SILC-S-B/162023.10 | 13.5 | |
| CAT-SegVLM=SILC-C-B/162023.10 | 13.4 | |
| CAT-SegVLM=CLIP-G/142023.10 | 13.3 | |
| USE+SAMVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 13.3 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 12.5 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 12 | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff2025.05 | 11.4 | |
| EBSegVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 11.1 | |
| ODISEVLM=ViT-L/14, Training Dataset=COCO Panoptic [20]2025.05 | 11.1 | |
| CAT-SegVLM=CLIP-L/142023.10 | 10.8 | |
| SCANVLM=ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 10.8 | |
| CAT-SegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 10.8 | |
| SANVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 10.1 | |
| OVSegVLM=CLIP-L/142023.10 | 9 | |
| OVSegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 9 | |
| CAT-SegVLM=CLIP-B/162023.10 | 8.4 | |
| CAT-SegVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 8.4 | |
| Ding et al.VLM=ViT-L/14, Training Dataset=COCO Panoptic [20]2025.05 | 8.2 | |
| OpenSegVLM=ALIGN, Backbone=Eff-B7 [44], Training Dataset=COCO Panoptic [20] + Loc. Narr. [36]2025.05 | 8.1 | |
| OVSegVLM=CLIP-B/162023.10 | 7.1 | |
| ZSsegVLM=CLIP-L/142023.10 | 7.1 | |
| OVSegVLM=ViT-B/16, Backbone=ResNet-101c, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 7.1 | |
| ZSsegVLM=CLIP-B/162023.10 | 7 | |
| SimSegVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 7 | |
| ZegFormerVLM=CLIP-B/162023.10 | 5.6 | |
| ZegFormerVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 5.6 | |
| OpenSegVLM=ALIGN, Backbone=ResNet-101, Training Dataset=COCO Panoptic [20] + Loc. Narr. [36]2025.05 | 4.4 | |
| Han et al.VLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO Panoptic [20]2025.05 | 3.5 | |
| LSeg+VLM=ALIGN RN-101, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 2.5 |