Semantic Segmentation on ADE20K 847 categories (val)
16.3mIoUDiSa
Evaluation Results
| Method | Links | |
|---|---|---|
| DiSaVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 16.3 | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 16 | |
| MAFT+VLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 15.1 | |
| DPSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 14.9 | |
| FC-CLIPVLM Backbone=ConvNeXt-L, Ensemble Operation=true2024.08 | 14.8 | |
| SCANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 14 | |
| SEDVLM=ConvNeXt-L, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 13.9 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 13.7 | |
| MAFTVLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 13.1 | |
| MAFTVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 12.7 | |
| DiSaVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 12.6 | |
| SANVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 12.4 | |
| SANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 12.4 | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 12 | |
| DPSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 12 | |
| SEDVLM=ConvNeXt-B, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 11.4 | |
| FC-CLIPVLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 11.2 | |
| ODISEVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 11.1 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 11.1 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 11.1 | |
| SANVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 10.1 | |
| OVSegVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 9 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 9 | |
| OpenSegVLM Backbone=ALIGN, Ensemble Operation=false2024.08 | 8.8 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=Yes2026.01 | 8.1 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 7.1 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 7 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 5.6 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=No2026.01 | 4.9 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=Yes2026.01 | 4.4 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 2.5 |