Semantic Segmentation on ADE20K 847
1,690mIoULSMSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| LSMSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 1,690 | |
| MaskAdapterVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 1,620 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 1,600 | |
| MAFT+VLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 1,510 | |
| DPSegVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 1,490 | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic2024.11 | 1,480 | |
| SCANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 1,400 | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 1,390 | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 1,370 | |
| LSMSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 1,310 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 1,240 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 1,200 | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff2024.11 | 1,140 | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 1,110 | |
| ODISEVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 1,110 | |
| SCANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 1,080 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 1,010 | |
| OVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 900 | |
| OpenSegVLM=ALIGN EN-B7, Training Dataset=COCO Panoptic2024.11 | 810 | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff-1562024.11 | 710 | |
| OVSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 710 | |
| SimSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 710 | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 560 | |
| Lseg+VLM=ALIGN EN-B7, Training Dataset=COCO-Stuff2024.11 | 380 | |
| PCA-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 18.3 | |
| DeCLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 17.6 | |
| H-CLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 16.5 | |
| LLMFormerBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 16.5 | |
| LoGoSegVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 16.4 | |
| Mask-AdapterBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 16.2 | |
| PCA-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 16.1 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 16 | |
| CAT-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 16 | |
| LoGoSegVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 15.8 | |
| DeCLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 15.3 | |
| MAFT+VLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 15.1 | |
| PosSAMInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 14.9 | |
| FCCLIPInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 14.8 | |
| FC-CLIPVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 14.8 | |
| SCNVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 14.7 | |
| Mask-AdapterBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 14.2 | |
| MAFTP w/ MaskAdapter (Baseline)VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 14.2 | |
| SEDVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 13.9 | |
| SEDBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 13.9 | |
| MAFTP*VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 13.8 | |
| SANInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 13.7 | |
| SANVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 13.7 | |
| EBSegVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 13.7 | |
| EBSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 13.7 | |
| LoGoSegVLM=ViT-B/16, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 12.6 | |
| H-CLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 12.5 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 12.4 | |
| LoGoSegVLM=ConvNeXt-B, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 12.2 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 12 | |
| CAT-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 12 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 12 | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 11.7 | |
| SEDVLM=ConvNeXt-B, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 11.4 | |
| SEDBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 11.4 | |
| SEDVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 11.4 | |
| ODISETraining Dataset=COCO, Supervision: label=true, Supervision: mask=true, Supervision: caption=false2023.03 | 11.1 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 11.1 | |
| EBSegVLM=ViT-B/16, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 11.1 | |
| ODISEVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 11.1 | |
| EBSegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 11.1 | |
| ODISEBackbone=ViT-L/14, Training Dataset=COCO-Panoptic2026.03 | 11.1 | |
| ODISETraining Dataset=COCO, Supervision: label=false, Supervision: mask=false, Supervision: caption=true2023.03 | 11 | |
| ODISEInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 11 | |
| CAT-SegVLM=ViT-L/14, Feature backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 10.8 | |
| MaskQCLIPInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 10.7 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 10.1 | |
| SANVLM=ViT-B/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 10.1 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 10.1 | |
| OVSegbackbone=Swin-B, training dataset=COCO-Stuff-1712022.10 | 9 | |
| OVSegInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 9 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=true2023.03 | 9 | |
| OVSegVLM=ViT-L/14, Feature backbone=Swin-B, Training Dataset=COCO-Stuff+COCO Caption, Additional Dataset=true2026.02 | 9 | |
| OVSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff + Caption2026.03 | 9 | |
| OpenSegVLM=ALIGN, Training Dataset=COCO Panoptic+Loc. Narr.2026.06 | 8.8 | |
| CAT-SegVLM=ViT-B/16, Feature backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 8.4 | |
| MaskCLIPTraining Dataset=COCO, Supervision: label=true, Supervision: mask=false, Supervision: caption=false2023.03 | 8.2 | |
| MaskCLIPInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 8.2 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2023.03 | 8.1 | |
| OpenSegVLM=ALIGN, Feature backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 8.1 | |
| OVSegbackbone=R-101c, training dataset=COCO-Stuff-1712022.10 | 7.1 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=true2023.03 | 7.1 | |
| DeOPVLM=ViT-B/16, Feature backbone=ResNet-101c, Training Dataset=COCO-Stuff-156, Additional Dataset=false2026.02 | 7.1 | |
| OVSegVLM=ViT-B/16, Feature backbone=ResNet-101c, Training Dataset=COCO-Stuff+COCO Caption, Additional Dataset=true2026.02 | 7.1 | |
| OVSegBackbone=ViT-B/16, Training Dataset=COCO-Stuff + Caption2026.03 | 7.1 | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 7.1 | |
| OvSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 7.1 | |
| OVSegbackbone=R-101c, training dataset=COCO-Stuff-1562022.10 | 7 | |
| ZSSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 7 | |
| ZSsegVLM=ViT-B/16, Feature backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 7 | |
| ZSsegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 7 | |
| OpenSegbackbone=Eff-B7, training dataset=COCO Panoptic2022.10 | 6.3 | |
| OpenSegTraining Dataset=COCO, Supervision: label=false, Supervision: mask=false, Supervision: caption=true2023.03 | 6.3 | |
| OpenSegInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 6.3 | |
| ZegFormer†VLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 5.6 | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 5.6 |