Semantic Segmentation on PASCAL-Context PC-459
24.5mIoULoGoSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| LoGoSegVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 24.5 | |
| DPSegVLM=ConvNeXt-L, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 24.1 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 23.8 | |
| LoGoSegVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 23.6 | |
| DPSegVLM=ConvNeXt-L, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 23.5 | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2025.05 | 22.6 | |
| SEDVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 22.6 | |
| MAFT+VLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 21.6 | |
| EBSegVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 21 | |
| EBSegVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 21 | |
| CAT-SegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 20.4 | |
| CAT-SegVLM=ViT-L/14, Feature backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 20.4 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 20.1 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 19.5 | |
| LoGoSegVLM=ViT-B/16, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 19.5 | |
| LoGoSegVLM=ConvNeXt-B, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 19.3 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 19 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 19 | |
| SCNVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 18.8 | |
| PosSAMInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 18.7 | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff2025.05 | 18.6 | |
| SEDVLM=ConvNeXt-B, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 18.6 | |
| SEDVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 18.6 | |
| MAFTP*VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 18.5 | |
| MaskQCLIPInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 18.2 | |
| FCCLIPInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 18.2 | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic [20]2025.05 | 18.2 | |
| FC-CLIPVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 18.2 | |
| MAFTP w/ MaskAdapter (Baseline)VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 17.9 | |
| EBSegVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 17.3 | |
| EBSegVLM=ViT-B/16, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 17.3 | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 17.3 | |
| SANInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 17.1 | |
| SANVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 17.1 | |
| SANVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 17.1 | |
| SCANVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 16.7 | |
| CAT-SegVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 16.6 | |
| CAT-SegVLM=ViT-B/16, Feature backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 16.6 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 15.7 | |
| USE+SAMVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 14.7 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 14.5 | |
| ODISEVLM=ViT-L/14, Training Dataset=COCO Panoptic [20]2025.05 | 14.5 | |
| ODISEVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 14.5 | |
| ODISEInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 13.8 | |
| SCANVLM=ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 13.2 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 12.6 | |
| SANVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 12.6 | |
| SANVLM=ViT-B/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 12.6 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 12.6 | |
| OVSegInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 12.4 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=true2023.03 | 12.4 | |
| OVSegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 12.4 | |
| OVSegVLM=ViT-L/14, Feature backbone=Swin-B, Training Dataset=COCO-Stuff+COCO Caption, Additional Dataset=true2026.02 | 12.4 | |
| OpenSegVLM=ALIGN, Training Dataset=COCO Panoptic+Loc. Narr.2026.06 | 12.2 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2023.03 | 11.5 | |
| OpenSegVLM=ALIGN, Backbone=Eff-B7 [44], Training Dataset=COCO Panoptic [20] + Loc. Narr. [36]2025.05 | 11.5 | |
| OpenSegVLM=ALIGN, Feature backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 11.5 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=true2023.03 | 11 | |
| OVSegVLM=ViT-B/16, Backbone=ResNet-101c, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 11 | |
| OVSegVLM=ViT-B/16, Feature backbone=ResNet-101c, Training Dataset=COCO-Stuff+COCO Caption, Additional Dataset=true2026.02 | 11 | |
| OvSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 11 | |
| ZegFormer†VLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 10.4 | |
| ZegFormerVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 10.4 | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 10.4 | |
| MaskCLIPInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 10 | |
| Ding et al.VLM=ViT-L/14, Training Dataset=COCO Panoptic [20]2025.05 | 10 | |
| DeOPVLM=ViT-B/16, Feature backbone=ResNet-101c, Training Dataset=COCO-Stuff-156, Additional Dataset=false2026.02 | 9.4 | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 9.4 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2023.03 | 9.1 | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2026.02 | 9.1 | |
| OpenSegInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 9 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=true2023.03 | 7.9 | |
| OpenSegVLM=ALIGN, Backbone=ResNet-101, Training Dataset=COCO Panoptic [20] + Loc. Narr. [36]2025.05 | 7.9 | |
| OpenSegVLM=ALIGN, Feature backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 7.9 | |
| LSegInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 7.8 | |
| Han et al.VLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO Panoptic [20]2025.05 | 7.1 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 5.2 | |
| LSeg+VLM=ALIGN RN-101, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 5.2 | |
| GroupViTInference Setting=Zero-shot, Training Dataset=COCO2024.03 | 4.9 | |
| GroupViTVLM=ViT-S/16, Feature backbone=-, Training Dataset=GCC+YFCC, Additional Dataset=true2026.02 | 4.9 |