Semantic Segmentation on PASCAL-Context 59 classes (test)
62.3mIoUDPSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| DPSegVLM=ConvNeXt-L, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 62.3 | |
| CAT-SegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 62 | |
| DPSegVLM=ConvNeXt-L, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 62 | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2025.05 | 60.6 | |
| DPT-Hybrid#params.=124.0M, FLOPs=1231.5G, Multi-scale testing=true, Extra pre-training on ADE20K=true2021.10 | 60.5 | |
| SANVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 60.2 | |
| EBSegVLM=ViT-L/14, Training Dataset=COCO-Stuff2025.05 | 60.2 | |
| HIPIEVLM=BERT-B, Backbone=ViT-H, Training Dataset=COCO Panoptic [20]2025.05 | 59.3 | |
| SCANVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 59.3 | |
| HRFormer-B + OCR#params.=56.2M, FLOPs=1119.9G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 58.5 | |
| SCANVLM=ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 58.4 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=II, Training Dataset=COCO-Stuff2025.05 | 58.4 | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic [20]2025.05 | 58.4 | |
| DPSegVLM=ConvNeXt-B, Inference Mode=I, Training Dataset=COCO-Stuff2025.05 | 58.1 | |
| USE+SAMVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff2025.05 | 57.8 | |
| CAT-SegVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 57.5 | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff2025.05 | 57.3 | |
| ODISEVLM=ViT-L/14, Training Dataset=COCO Panoptic [20]2025.05 | 57.3 | |
| EBSegVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 56.7 | |
| HRNet-W48 + OCR#params.=74.5M, FLOPs=924.7G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 56.2 | |
| SETR-MLA#params.=309.5M, FLOPs=2138.6G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 55.8 | |
| OVSegVLM=ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 55.7 | |
| SETR-PUP#params.=317.8M, FLOPs=2326.7G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 55.3 | |
| GFFNetBackbone=ResNet-1012019.04 | 54.2 | |
| Deeplabv3#params.=87.1M, FLOPs=1394.0G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 54.1 | |
| PSPNet#params.=68.0M, FLOPs=1028.8G, Multi-scale testing=true, Extra pre-training on ADE20K=false2021.10 | 54 | |
| SANVLM=ViT-B/16, Training Dataset=COCO-Stuff2025.05 | 53.8 | |
| BFPBackbone=ResNet-101, UAGS=true, Boundary aware=true, multi-scale testing=true2019.08 | 53.6 | |
| OVSegVLM=ViT-B/16, Backbone=ResNet-101c, Training Dataset=COCO-Stuff+COCO Caption2025.05 | 53.3 | |
| SVCNetBackbone=ResNet-1012019.04 | 53.2 | |
| DANetBackbone=ResNet-1012019.04 | 52.6 | |
| EncNet2019.08 | 51.7 | |
| EncNetBackbone=ResNet-1012019.04 | 51.7 | |
| CCL+GMA2019.08 | 51.6 | |
| CCLNetBackbone=ResNet-1012019.04 | 51.6 | |
| GFFNetBackbone=ResNet-502019.04 | 51 | |
| MSCI2019.08 | 50.3 | |
| DANetBackbone=ResNet-502019.04 | 50.1 | |
| PACLVLM=ViT-B/16, Training Dataset=GCC [41] + YFCC[45]2025.05 | 50.1 | |
| EncNetBackbone=ResNet-502019.04 | 49 | |
| PSPNetBackbone=ResNet-1012019.04 | 47.8 | |
| SimSegVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 47.7 | |
| RefineNet2019.08 | 47.3 | |
| Ding et al.VLM=ViT-L/14, Training Dataset=COCO Panoptic [20]2025.05 | 45.9 | |
| DeepLabMSC=true, COCO=true, Aug=true, ASPP=true, CRF=true, Backbone=ResNet-1012016.06 | 45.7 | |
| DeepLab-v2+CRF2019.08 | 45.7 | |
| ZegFormerVLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 45.5 | |
| Han et al.VLM=ViT-B/16, Backbone=ResNet-101, Training Dataset=COCO Panoptic [20]2025.05 | 45.2 | |
| EFCN2019.08 | 45 | |
| OpenSegVLM=ALIGN, Backbone=Eff-B7 [44], Training Dataset=COCO Panoptic [20] + Loc. Narr. [36]2025.05 | 44.8 | |
| DeepLabMSC=true, COCO=true, Aug=true, ASPP=true, Backbone=ResNet-1012016.06 | 44.7 | |
| VeryDeep2016.06 | 44.5 | |
| DAG-RNN2019.08 | 43.7 | |
| DeepLabMSC=true, COCO=true, Aug=true, Backbone=ResNet-1012016.06 | 43.5 | |
| Context2016.06 | 43.3 | |
| DeepLabMSC=true, COCO=true, Backbone=ResNet-1012016.06 | 42.9 | |
| DeepLabMSC=true, Backbone=ResNet-1012016.06 | 41.4 | |
| PixelNet2019.08 | 41.4 | |
| HO_CRF2016.06 | 41.3 | |
| HO-CRF2019.08 | 41.3 | |
| BoxSup2016.06 | 40.5 | |
| BoxSup2019.08 | 40.5 | |
| ParseNet2016.06 | 40.4 | |
| OpenSegVLM=ALIGN, Backbone=ResNet-101, Training Dataset=COCO Panoptic [20] + Loc. Narr. [36]2025.05 | 40.1 | |
| DeepLabLargeFOV=true, CRF=true, Backbone=VGG-162016.06 | 39.6 | |
| DeepLab (ResNet-101)Backbone=ResNet-1012016.06 | 39.6 | |
| CRF-RNN2016.06 | 39.3 | |
| FCN-8s2019.08 | 39.1 | |
| ZS3NetBackbone=ResNet-101, Training Dataset=PASCAL VOC2025.05 | 38.3 | |
| FCN-8s2016.06 | 37.8 | |
| DeepLab (VGG-16)LargeFOV=true, Backbone=VGG-162016.06 | 37.6 | |
| LSeg+VLM=ALIGN RN-101, Backbone=ResNet-101, Training Dataset=COCO-Stuff2025.05 | 36 | |
| CFM2016.06 | 34.4 | |
| O2P2016.06 | 18.1 | |
| O2P2019.08 | 18.1 |