Semantic Segmentation on ADE20K A-847 (val)
1,400mIoUSCAN
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SCANVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 1,400 | — | |
| SANVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 1,240 | — | |
| ODISEVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 1,110 | — | |
| SCANVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 1,080 | — | |
| MAFTVL-Model=CLIP ViT-B/16, Training Dataset=COCO2023.12 | 1,010 | — | |
| SANVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 1,010 | — | |
| OVSegVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 900 | — | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO+Loc. Narr.2023.12 | 880 | — | |
| MaskCLIPVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 820 | — | |
| OVSegVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 710 | — | |
| SimSeg†VL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 710 | — | |
| SimSegVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 700 | — | |
| SimSeg†VL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 690 | — | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO2023.12 | 630 | — | |
| OpenSegVL-Model=ALIGN RN101, Training Dataset=COCO2023.12 | 400 | — | |
| LSeg+VL-Model=ALIGN EN-B7, Training Dataset=COCO2023.12 | 380 | — | |
| LSeg+VL-Model=ALIGN RN101, Training Dataset=COCO2023.12 | 250 | — | |
| FC-CLIPtraining dataset=COCO Panoptic2023.08 | 14.8 | — | |
| SANtraining dataset=COCO Stuff [5]2023.08 | 13.7 | — | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 13.7 | — | |
| SANModel=ViT-L/142023.10 | 12.4 | 25.2 | |
| Cat-Seg+CLIPSelfModel=ViT-L/142023.10 | 12.4 | 25.4 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 12.4 | — | |
| SAM w/ Mask-AdapterBackbone=SAM-H, Setting=Open-vocabulary2024.12 | 11.4 | — | |
| ODISEtraining dataset=COCO Panoptic2023.08 | 11.1 | — | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 11.1 | — | |
| ODISEVLM=SD+CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.06 | 11.1 | — | |
| ODISEtraining dataset=COCO Panoptic + COCO Caption, variant=caption2023.08 | 11 | — | |
| Cat-SegModel=ViT-L/142023.10 | 10.8 | 20.5 | |
| SANModel=ViT-B/162023.10 | 10.1 | 21.1 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 10.1 | — | |
| SAM w/ MAFTBackbone=SAM-H, Setting=Open-vocabulary2024.12 | 10.1 | — | |
| HIPIE w/ CLIPTraining Data=O365, COCO, RefCOCO, PACO, CLIP2023.07 | 9.7 | — | |
| APE (C)Backbone=ViT-L2023.12 | 9.4 | — | |
| X-DecoderBackbone=DaViT-L2023.12 | 9.2 | — | |
| APE (B)Backbone=ViT-L2023.12 | 9.2 | — | |
| APE (D)Backbone=ViT-L2023.12 | 9.2 | — | |
| X-DecoderTraining Data=COCO, CC3M, SBU-C, VG, COCO-Caption, (Florence)2023.07 | 9.2 | — | |
| Cat-Seg+CLIPSelfModel=ViT-B/162023.10 | 9.2 | 20.1 | |
| OVSegtraining dataset=COCO Stuff [5]2023.08 | 9 | — | |
| OVSegBackbone=Swin-B2023.12 | 9 | — | |
| OVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 9 | — | |
| OpenSegBackbone=ENB72023.12 | 8.8 | — | |
| OpenSegVLM=ALIGN EN-B7, Training Dataset=COCO Panoptic[15]+Loc.Narr.2024.06 | 8.8 | — | |
| Cat-SegModel=ViT-B/162023.10 | 8.4 | 16.6 | |
| MaskCLIPtraining dataset=COCO Panoptic2023.08 | 8.2 | — | |
| MaskCLIPVLM=CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.06 | 8.2 | — | |
| MaskCLIPCOCO Training Data=Masks + Labels2022.08 | 8.2 | — | |
| OVSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff+COCO Caption[4]2024.06 | 7.1 | — | |
| SimSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 7.1 | — | |
| SAM w/ CLIPBackbone=SAM-H, Setting=Open-vocabulary2024.12 | 7.1 | — | |
| SimSegCOCO Training Data=Masks + Labels2022.08 | 7 | — | |
| SimSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 6.9 | — | |
| MaskCLIP (MaskRCNN)COCO Training Data=Masks + Labels2022.08 | 6.8 | — | |
| OpenSegtraining dataset=COCO Panoptic + COCO Caption2023.08 | 6.3 | — | |
| OpenSegCOCO Training Data=Masks + Captions2022.08 | 6.3 | — | |
| ALIGN w/ proposalsCOCO Training Data=Masks2022.08 | 5.8 | — | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 5.6 | — | |
| MaskCLIP w/o RMACOCO Training Data=Masks2022.08 | 5.6 | — | |
| CLIP BaselineCOCO Training Data=Masks2022.08 | 5.2 | — | |
| HIPIE w/o CLIPTraining Data=O365, COCO, RefCOCO, PACO2023.07 | 4.8 | — | |
| GroupViTtraining dataset=GCC [75]+YFCC [79]2023.08 | 4.3 | — | |
| APE (A)Backbone=ViT-L2023.12 | 4.1 | — | |
| ALIGNCOCO Training Data=None2022.08 | 4.1 | — | |
| OpenSegVLM=ALIGN RN-101, Training Dataset=COCO Panoptic[15]2024.06 | 4 | — | |
| LSeg+training dataset=COCO Stuff [5]2023.08 | 3.8 | — | |
| LSeg+VLM=ALIGN EN-B7, Training Dataset=COCO-Stuff2024.06 | 3.8 | — | |
| LSeg+COCO Training Data=Masks + Labels2022.08 | 3.8 | — | |
| LSeg+VLM=ALIGN RN-101, Training Dataset=COCO-Stuff2024.06 | 2.5 | — | |
| UNINEXTTraining Data=O365, COCO, RefCOCO2023.07 | 1.8 | — |