Semantic Segmentation on PASCAL Context 59 (mIoU)
63.6mIoULoGoSeg
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LoGoSegVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 63.6 | — | — | — | |
| LoGoSegVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 63.2 | — | — | — | |
| CAT-SegVLM=ViT-L/14, Feature backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 62 | — | — | — | |
| SEDVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 60.6 | — | — | — | |
| SANVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 60.2 | — | — | — | |
| EBSegVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 60.2 | — | — | — | |
| MAFT+VLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 59.4 | — | — | — | |
| HIPIEVLM=BERT-B, Feature backbone=ViT-H, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 59.3 | — | — | — | |
| SCNVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 58.6 | — | — | — | |
| FC-CLIPVLM=ConvNeXt-L, Feature backbone=-, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 58.4 | — | — | — | |
| MAFTP w/ MaskAdapter (Baseline)VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 58.4 | — | — | — | |
| LoGoSegVLM=ViT-B/16, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 58.2 | — | — | — | |
| LoGoSegVLM=ConvNeXt-B, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 57.8 | — | — | — | |
| CAT-SegVLM=ViT-B/16, Feature backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 57.5 | — | — | — | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 57.5 | — | — | — | |
| MAFTP*VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 57.5 | — | — | — | |
| SEDVLM=ConvNeXt-B, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 57.3 | — | — | — | |
| ODISEVLM=ViT-L/14, Feature backbone=-, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 57.3 | — | — | — | |
| SEDVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 57.3 | — | — | — | |
| EBSegVLM=ViT-B/16, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 56.7 | — | — | — | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 56.7 | — | — | — | |
| OVSegVLM=ViT-L/14, Feature backbone=Swin-B, Training Dataset=COCO-Stuff+COCO Caption, Additional Dataset=true2026.02 | 55.7 | — | — | — | |
| SANVLM=ViT-B/14, Feature backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 53.8 | — | — | — | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 53.8 | — | — | — | |
| OVSegVLM=ViT-B/16, Feature backbone=ResNet-101c, Training Dataset=COCO-Stuff+COCO Caption, Additional Dataset=true2026.02 | 53.3 | — | — | — | |
| OvSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 53.3 | — | — | — | |
| PACLVLM=ViT-B/16, Feature backbone=-, Training Dataset=GCC+YFCC, Additional Dataset=true2026.02 | 50.1 | — | — | — | |
| DeOPVLM=ViT-B/16, Feature backbone=ResNet-101c, Training Dataset=COCO-Stuff-156, Additional Dataset=false2026.02 | 48.8 | — | — | — | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 48.8 | — | — | — | |
| OpenSegVLM=ALIGN, Training Dataset=COCO Panoptic+Loc. Narr.2026.06 | 48.2 | — | — | — | |
| ZSsegVLM=ViT-B/16, Feature backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2026.02 | 47.7 | — | — | — | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 45.5 | — | — | — | |
| OpenSegVLM=ALIGN, Feature backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 44.8 | — | — | — | |
| ZegFormerVLM=ViT-B/16, Feature backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2026.02 | 42.8 | — | — | — | |
| OpenSegVLM=ALIGN, Feature backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=true2026.02 | 40.1 | — | — | — | |
| ProxyCLIPBackbone=OpenCLIP-ViT-H/14, Training Strategy=Zero-shot2024.08 | 39.6 | — | — | — | |
| ProxyCLIPBackbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 39.1 | — | — | — | |
| ProxyCLIPBackbone=CLIP-ViT-L/14, Training Strategy=Zero-shot2024.08 | 37.7 | — | — | — | |
| NACLIP + ResCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 36.8 | — | — | — | |
| ClearCLIP + ResCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 36.4 | — | — | — | |
| CLIP-DINOiserTraining Strategy=Training-based2024.08 | 35.9 | — | — | — | |
| ClearCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 35.9 | — | — | — | |
| SCLIP + ResCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 35.8 | — | — | — | |
| NACLIPTraining-free=true, Encoder=ViT-B/162024.11 | 35.2 | — | — | — | |
| NACLIP + ResCLIPTraining-free=true, Encoder=ViT-L/142024.11 | 34.5 | — | — | — | |
| ClearCLIP + ResCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 34.3 | — | — | 38.4 | |
| SCLIPBackbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 34.2 | — | — | — | |
| SCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 34.2 | — | — | — | |
| ClearCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 34.1 | — | — | 37.9 | |
| ClearCLIP + ResCLIPTraining-free=true, Encoder=ViT-L/142024.11 | 33.4 | — | — | — | |
| NACLIP + ResCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 33 | — | — | 37.9 | |
| SCLIP + ResCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 32.9 | — | — | 35.5 | |
| NACLIPTraining-free=true, Encoder=ViT-L/142024.11 | 32.1 | — | — | — | |
| SCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 31.7 | — | — | 33.9 | |
| SCLIP + ResCLIPTraining-free=true, Encoder=ViT-L/142024.11 | 30.6 | — | — | — | |
| TCLTraining Strategy=Training-based2024.08 | 30.3 | — | — | — | |
| TCLTraining-free=false, Encoder=ViT-B/162024.11 | 30.3 | — | — | — | |
| NACLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 30.3 | — | — | 35.3 | |
| ClearCLIPTraining-free=true, Encoder=ViT-L/142024.11 | 29.6 | — | — | — | |
| MaskCLIP+Backbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 26.4 | — | — | — | |
| MaskCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 26.4 | — | — | — | |
| GroupViTVLM=ViT-S/16, Feature backbone=-, Training Dataset=GCC+YFCC, Additional Dataset=true2026.02 | 25.9 | — | — | — | |
| SCLIPBackbone=OpenCLIP-ViT-H/14, Training Strategy=Zero-shot2024.08 | 25.6 | — | — | — | |
| SCLIPBackbone=CLIP-ViT-L/14, Training Strategy=Zero-shot2024.08 | 25.2 | — | — | — | |
| EVACLIP (+LazyStrike)Backbone=ViT-B/16, Zero-shot=true2026.02 | 24.7 | — | — | — | |
| GroupViTTraining Strategy=Training-based2024.08 | 23.4 | — | — | — | |
| GroupViTTraining-free=false, Encoder=ViT-S/162024.11 | 23.4 | — | — | — | |
| ReCo+Backbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 22.3 | — | — | — | |
| ReCoTraining-free=true, Encoder=ViT-B/162024.11 | 22.3 | — | — | — | |
| EVACLIP (+LazyStrike)Backbone=ViT-L/14, Zero-shot=true2026.02 | 21.7 | — | — | — | |
| SCLIPTraining-free=true, Encoder=ViT-L/142024.11 | 20.5 | — | — | — | |
| EVACLIPBackbone=ViT-L/14, Zero-shot=true2026.02 | 16.6 | — | — | — | |
| MetaCLIP (+LazyStrike)Backbone=ViT-L/14, Zero-shot=true2026.02 | 16 | — | — | — | |
| MaskCLIPBackbone=OpenCLIP-ViT-H/14, Training Strategy=Zero-shot2024.08 | 15.8 | — | — | — | |
| MetaCLIP (+LazyStrike)Backbone=ViT-B/16, Zero-shot=true2026.02 | 15.5 | — | — | — | |
| CLIP (+LazyStrike)Backbone=ViT-B/16, Zero-shot=true2026.02 | 15.2 | — | — | — | |
| CLIP (+LazyStrike)Backbone=ViT-L/14, Zero-shot=true2026.02 | 15.1 | — | — | — | |
| EVACLIPBackbone=ViT-B/16, Zero-shot=true2026.02 | 14.1 | — | — | — | |
| MaskCLIPTraining-free=true, Encoder=ViT-L/142024.11 | 12.6 | — | — | — | |
| MaskCLIPBackbone=CLIP-ViT-L/14, Training Strategy=Zero-shot2024.08 | 12.4 | — | — | — | |
| CLIPBackbone=ViT-B/16, Zero-shot=true2026.02 | 11.2 | — | — | — | |
| MetaCLIPBackbone=ViT-B/16, Zero-shot=true2026.02 | 9.3 | — | — | — | |
| CLIPBackbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 9.2 | — | — | — | |
| CLIPTraining-free=true, Encoder=ViT-B/162024.11 | 9.2 | — | — | — | |
| OpenCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 9 | — | — | 13.84 | |
| MetaCLIPBackbone=ViT-L/14, Zero-shot=true2026.02 | 8.9 | — | — | — | |
| OpenCLIPBackbone=OpenCLIP-ViT-H/14, Training Strategy=Zero-shot2024.08 | 5.5 | — | — | — | |
| CLIPBackbone=ViT-L/14, Zero-shot=true2026.02 | 5.1 | — | — | — | |
| CLIPTraining-free=true, Encoder=ViT-L/142024.11 | 4.5 | — | — | — | |
| CLIPBackbone=CLIP-ViT-L/14, Training Strategy=Zero-shot2024.08 | 4.4 | — | — | — | |
| CAAEncoder=R1012022.12 | — | — | 55 | — | |
| CAAEncoder=EfficientNet-B72022.12 | — | — | 60.5 | — | |
| CAREncoder=ConvNext-L2022.12 | — | 62.97 | 64.12 | — | |
| CAREncoder=Swin-L2022.12 | — | 60.68 | 62.21 | — | |
| CPNetEncoder=R1012022.12 | — | — | 53.9 | — | |
| DANetEncoder=R1012022.12 | — | — | 52.6 | — | |
| DPTEncoder=ViT-Hybrid-L2022.12 | — | — | 60.5 | — | |
| EncNetEncoder=R1012022.12 | — | — | 51.7 | — | |
| OCRNetEncoder=R1012022.12 | — | — | 54.8 | — | |
| OCRNetEncoder=HRW482022.12 | — | — | 56.2 | — |