Semantic Segmentation on ADE20K A-150 (val)
38.9mIoUDiSa
Evaluation Results
| Method | Links | |
|---|---|---|
| DiSaVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 38.9 | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 37.9 | |
| DPSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 36.4 | |
| SEDVLM=ConvNeXt-L, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 35.2 | |
| FC-CLIPtraining dataset=COCO Panoptic2023.08 | 34.1 | |
| DiSaVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 33.7 | |
| SCANVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 33.5 | |
| SCANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 33.5 | |
| SANtraining dataset=COCO Stuff [5]2023.08 | 33.3 | |
| DPSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 32.9 | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 32.8 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 32.8 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 32.1 | |
| SANVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 32.1 | |
| SANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 32.1 | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 31.8 | |
| SEDVLM=ConvNeXt-B, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 31.6 | |
| SCANVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 30.8 | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 30 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 30 | |
| ODISEtraining dataset=COCO Panoptic2023.08 | 29.9 | |
| ODISEVLM=SD+CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.06 | 29.9 | |
| ODISEVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 29.9 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 29.9 | |
| OVSegtraining dataset=COCO Stuff [5]2023.08 | 29.6 | |
| OVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 29.6 | |
| OVSegVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 29.6 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 29.6 | |
| MAFTVL-Model=CLIP ViT-B/16, Training Dataset=COCO2023.12 | 29.1 | |
| ODISEtraining dataset=COCO Panoptic + COCO Caption, variant=caption2023.08 | 28.7 | |
| OpenSegVLM=ALIGN EN-B7, Training Dataset=COCO Panoptic[15]+Loc.Narr.2024.06 | 28.6 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO+Loc. Narr.2023.12 | 28.6 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 27.5 | |
| SANVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 27.5 | |
| SANVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 27.5 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=Yes2026.01 | 26.4 | |
| OVSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff+COCO Caption[4]2024.06 | 24.8 | |
| OVSegVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 24.8 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 24.8 | |
| MaskCLIPtraining dataset=COCO Panoptic2023.08 | 23.7 | |
| MaskCLIPVLM=CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.06 | 23.7 | |
| MaskCLIPVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 23.7 | |
| SimSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 21.7 | |
| SimSeg†VL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 21.7 | |
| OpenSegtraining dataset=COCO Panoptic + COCO Caption2023.08 | 21.1 | |
| SimSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 21.1 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO2023.12 | 21.1 | |
| SimSeg†VL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 21.1 | |
| SimSegVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 20.5 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 20.5 | |
| LSeg+training dataset=COCO Stuff [5]2023.08 | 18 | |
| LSeg+VLM=ALIGN EN-B7, Training Dataset=COCO-Stuff2024.06 | 18 | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 18 | |
| LSeg+VL-Model=ALIGN EN-B7, Training Dataset=COCO2023.12 | 18 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 18 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=Yes2026.01 | 17.5 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=No2026.01 | 16.9 | |
| ZegFormertraining dataset=COCO Stuff [5]2023.08 | 16.4 | |
| SimBaselinetraining dataset=COCO Stuff [5]2023.08 | 15.3 | |
| OpenSegVLM=ALIGN RN-101, Training Dataset=COCO Panoptic[15]2024.06 | 15.3 | |
| OpenSegVL-Model=ALIGN RN101, Training Dataset=COCO2023.12 | 15.3 | |
| LSeg+VLM=ALIGN RN-101, Training Dataset=COCO-Stuff2024.06 | 13 | |
| LSeg+VL-Model=ALIGN RN101, Training Dataset=COCO2023.12 | 13 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 13 | |
| GroupViTtraining dataset=GCC [75]+YFCC [79]2023.08 | 10.6 |