Semantic Segmentation on ADE20K A-150
3,140mIoUCLIP + PACL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CLIP + PACLEncoder=ViT-B/16, External Training Set=GCC3M [44] + GCC12M [6] + YFCC15M [41,46], Annotation Constraint=No, Mask Constraint=No2022.12 | 3,140 | — | |
| CLIPEncoder=ViT-B/16, External Training Set=WIT-400M [41], Annotation Constraint=No, Mask Constraint=No2022.12 | 130 | — | |
| OraclesBackbone=SED [71]2025.03 | 50.66 | — | |
| SELF1E-2Btrained on corresponding datasets=true2026.03 | 50.2 | — | |
| PCA-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 41.5 | — | |
| CAT-Seg+DeCLIPBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 40.7 | — | |
| DeCLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 40.7 | — | |
| SAM 32025.11 | 39 | — | |
| LSMSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 38.5 | — | |
| LLMFormerBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 38.5 | — | |
| H-CLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 38.4 | — | |
| LoGoSegVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 38.2 | — | |
| MaskAdapterVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 38.2 | — | |
| Mask-AdapterBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 38.2 | — | |
| PCA-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 38.1 | — | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 37.9 | — | |
| CAT-SegBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 37.9 | — | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 37.9 | — | |
| CAT-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 37.9 | — | |
| LoGoSegVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 37.8 | — | |
| CAT-SegVLM=SILC-C-L/162023.10 | 37.7 | — | |
| CAT-SegVLM=SILC-S-B/162023.10 | 37 | — | |
| SemLABackbone=SED [71]2025.03 | 36.91 | — | |
| CAT-SegVLM=SILC-C-B/162023.10 | 36.6 | — | |
| DPSegVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 36.4 | — | |
| CAT-Seg+DeCLIPBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 36.3 | — | |
| DeCLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 36.3 | — | |
| CAT-SegVLM=CLIP-G/142023.10 | 36.2 | — | |
| SCNVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 36.2 | — | |
| MAFT+VLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 36.1 | — | |
| MAFT+VLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 36.1 | — | |
| OVSeg + OpenDASadaptation=OpenDAS2024.05 | 35.8 | 51.2 | |
| Mask-AdapterBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 35.6 | — | |
| MAFTP w/ MaskAdapter (Baseline)VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 35.6 | — | |
| Zero-shotBackbone=SED [71]2025.03 | 35.27 | — | |
| SEDVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 35.2 | — | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 35.2 | — | |
| SEDBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 35.2 | — | |
| PosSAMInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 35.1 | — | |
| UniformBackbone=SED [71]2025.03 | 34.92 | — | |
| MAFTP*VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 34.5 | — | |
| MAFTBackbone=ConvNeXt-L, Training Set=COCO-Stuff2025.05 | 34.4 | — | |
| FrozenSegBackbone=ConvNeXt-L, Training Set=COCO-Panoptic2025.05 | 34.4 | — | |
| FCCLIPInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 34.1 | — | |
| FC-CLIPBackbone=ConvNeXt-L, Training Set=COCO-Panoptic2025.05 | 34.1 | — | |
| FC-CLIPVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 34.1 | — | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic2024.11 | 34.1 | — | |
| SCANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 33.5 | — | |
| SANVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 33.3 | — | |
| SANInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 33.3 | — | |
| SANBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 33.3 | — | |
| SANVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 33.3 | — | |
| LSMSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 33.2 | — | |
| EBSegVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 32.8 | — | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 32.8 | — | |
| EBSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 32.8 | — | |
| LoGoSegVLM=ViT-B/16, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 32.6 | — | |
| H-CLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 32.4 | — | |
| SANVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=no2023.02 | 32.1 | — | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 32.1 | — | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 32.1 | — | |
| LoGoSegVLM=ConvNeXt-B, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 32 | — | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 31.8 | — | |
| CAT-SegBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 31.8 | — | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 31.8 | — | |
| CAT-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 31.8 | — | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 31.8 | — | |
| SEDVLM=ConvNeXt-B, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 31.6 | — | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff2024.11 | 31.6 | — | |
| SEDBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 31.6 | — | |
| SEDVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 31.6 | — | |
| CAT-SegVLM=CLIP-L/142023.10 | 31.5 | — | |
| CAT-SegVLM=ViT-L/14, Feature backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 31.5 | — | |
| CLIPSurgeryTraining-free=true, Encoder=ViT-B/162024.11 | 31.4 | — | |
| PACLVLM=ViT-B/16, Feature backbone=-, Training Dataset=GCC+YFCC, Additional Dataset=true2026.02 | 31.4 | — | |
| SCANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 30.8 | — | |
| CorrCLIPBackbone=ViT-L/14, Zero-shot=true2025.12 | 30.7 | — | |
| MaskQCLIPInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 30.4 | — | |
| EBSegVLM=ViT-B/16, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 30 | — | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 30 | — | |
| EBSegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 30 | — | |
| APE-D2025.11 | 30 | — | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 30 | — | |
| ODISETraining Dataset=COCO, Supervision: label=true, Supervision: mask=true, Supervision: caption=false2023.03 | 29.9 | — | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 29.9 | — | |
| ODISEBackbone=ViT-L/14, Training Set=COCO-Panoptic2025.05 | 29.9 | — | |
| ODISEVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 29.9 | — | |
| ODISEVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 29.9 | — | |
| ODISEBackbone=ViT-L/14, Training Dataset=COCO-Panoptic2026.03 | 29.9 | — | |
| OVSegadaptation=None2024.05 | 29.8 | 48.1 | |
| OvSegVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 29.6 | — | |
| OVSegbackbone=Swin-B, training dataset=COCO-Stuff-1712022.10 | 29.6 | — | |
| OVSegVLM=CLIP-L/142023.10 | 29.6 | — | |
| OVSegInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 29.6 | — | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=true2023.03 | 29.6 | — | |
| OVSegBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 29.6 | — | |
| OVSegVLM=ViT-L/14, Feature backbone=Swin-B, Training Dataset=COCO-Stuff+COCO Caption, Additional Dataset=true2026.02 | 29.6 | — | |
| OVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 29.6 | — | |
| OVSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff + Caption2026.03 | 29.6 | — | |
| FCNbackbone=FCN-8s, training dataset=Same as test2022.10 | 29.4 | — |