Semantic Segmentation on Pascal Context 59
66.55mIoUOracles
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OraclesBackbone=SED [71]2025.03 | 66.55 | — | |
| PCA-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 64.7 | — | |
| HyperSeg2026.03 | 64.6 | — | |
| SELF1E-2Btrained on corresponding datasets=true2026.03 | 64.6 | — | |
| LLMFormerBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 64.2 | — | |
| H-CLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 64.1 | — | |
| CAT-Seg+DeCLIPBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 63.9 | — | |
| DeCLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 63.9 | — | |
| LSMSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 63.4 | — | |
| CAT-SegBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 63.3 | — | |
| GiTAdditions=Parallel Decoding2026.01 | 63.3 | — | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 63.3 | — | |
| CAT-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 63.3 | — | |
| SemLABackbone=SED [71]2025.03 | 62.23 | — | |
| PCA-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 62.2 | — | |
| DPSegVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 62 | — | |
| Zero-shotBackbone=SED [71]2025.03 | 60.87 | — | |
| UniformBackbone=SED [71]2025.03 | 60.82 | — | |
| SAM3Additions=DETR-like Decoder2026.01 | 60.8 | — | |
| CAT-Seg+DeCLIPBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 60.6 | — | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 60.6 | — | |
| DeCLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 60.6 | — | |
| SEDBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 60.6 | — | |
| X-Decoder (DaViT-d5)Additions=X-Decoder2026.01 | 60.4 | — | |
| Youtu-VL (4B)Additions=None2026.01 | 60.4 | — | |
| MaskAdapterVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 60.4 | — | |
| Mask-AdapterBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 60.4 | — | |
| SANVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 60.2 | — | |
| SANBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 60.2 | — | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 60.2 | — | |
| EBSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 60.2 | — | |
| LSMSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 59.7 | — | |
| MAFT+VLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 59.4 | — | |
| SCANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 59.3 | — | |
| ESC-NetSize=ViT-B/16, Training Approach=Training-based2024.11 | 59 | — | |
| FC-CLIPBackbone=ConvNeXt-L, Training Set=COCO-Panoptic2025.05 | 58.4 | — | |
| SCANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 58.4 | — | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic2024.11 | 58.4 | — | |
| Mask-AdapterBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 58.4 | — | |
| H-CLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 57.9 | — | |
| SANVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=no2023.02 | 57.7 | — | |
| SAN (ViT-L)Additions=Decoupled Head2026.01 | 57.7 | — | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 57.7 | — | |
| CAT-SegSize=ViT-B/16, Training Approach=Training-based2024.11 | 57.5 | — | |
| MAFTBackbone=ConvNeXt-L, Training Set=COCO-Stuff2025.05 | 57.5 | — | |
| CAT-SegBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 57.5 | — | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 57.5 | — | |
| CAT-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 57.5 | — | |
| ODISETraining Dataset=COCO, Supervision: label=true, Supervision: mask=true, Supervision: caption=false2023.03 | 57.3 | — | |
| ODISEBackbone=ViT-L/14, Training Set=COCO-Panoptic2025.05 | 57.3 | — | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff2024.11 | 57.3 | — | |
| ODISEVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 57.3 | — | |
| SEDBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 57.3 | — | |
| ODISEBackbone=ViT-L/14, Training Dataset=COCO-Panoptic2026.03 | 57.3 | — | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 56.7 | — | |
| EBSegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 56.7 | — | |
| OvSegVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 55.7 | — | |
| OVSegbackbone=Swin-B, training dataset=COCO-Stuff-1712022.10 | 55.7 | — | |
| OVSegBackbone=Swin-B, Training data=COCO stuff+cap2023.06 | 55.7 | — | |
| OVSegBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 55.7 | — | |
| OVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 55.7 | — | |
| OVSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff + Caption2026.03 | 55.7 | — | |
| SANVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 55.4 | — | |
| ODISETraining Dataset=COCO, Supervision: label=false, Supervision: mask=false, Supervision: caption=true2023.03 | 55.3 | — | |
| ODISEBackbone=UNet+M2F, Training data=LAION+CLIP+COCO2023.06 | 55.3 | — | |
| SANVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=no2023.02 | 53.8 | — | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 53.8 | — | |
| OvSegVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 53.3 | — | |
| OVSegbackbone=R-101c, training dataset=COCO-Stuff-1712022.10 | 53.3 | — | |
| OVSegBackbone=R-101c, Training data=COCO stuff+cap2023.06 | 53.3 | — | |
| OVSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 53.3 | — | |
| OVSegBackbone=ViT-B/16, Training Dataset=COCO-Stuff + Caption2026.03 | 53.3 | — | |
| SimSeg (reproduced)VL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 52.2 | — | |
| SimSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 52.2 | — | |
| SimSeg (reproduced)VL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 51.9 | — | |
| OVSegbackbone=R-101c, training dataset=COCO-Stuff-1562022.10 | 51.7 | — | |
| DaTaSegBackbone=ViTDet-L, Training data=COCO panoptic + ADE semantic + O365 bbox2023.06 | 51.4 | — | |
| DaTaSegBackbone=ViTDet-B, Training data=COCO panoptic + ADE semantic2023.06 | 51.1 | — | |
| GoCAType=Ours, Backbone=Flux2026.03 | 51.1 | — | |
| DaTaSegBackbone=R-50, Training data=COCO panoptic2023.06 | 50.9 | — | |
| CorrCLIPSize=ViT-L/14, Training Approach=Training-free2024.11 | 50.8 | — | |
| CorrCLIPBackbone=ViT-L/14, Zero-shot=true2025.12 | 50.8 | — | |
| CLIPer + ARMBackbone=ViT-L/14, Zero-shot=true2025.12 | 50.7 | — | |
| CLIP + PACLEncoder=ViT-B/16, External Training Set=GCC3M [44] + GCC12M [6] + YFCC15M [41,46], Annotation Constraint=No, Mask Constraint=No2022.12 | 50.1 | — | |
| CLIPer + ARMBackbone=ViT-B/16, Zero-shot=true2025.12 | 49.5 | — | |
| CorrCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 48.8 | — | |
| CorrCLIPBackbone=ViT-B/16, Zero-shot=true2025.12 | 48.8 | — | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff-1562024.11 | 48.8 | — | |
| PSALM2026.03 | 48.5 | — | |
| FluxType=Vanilla2026.03 | 48.4 | — | |
| OpenSegEncoder=EfficientNet-B7, External Training Set=COCO [9] + Loc. Narr. [40], Annotation Constraint=Yes, Mask Constraint=No2022.12 | 48.2 | — | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO+Loc. Narr., ensemble=no2023.02 | 48.2 | — | |
| SCLIP + ARMBackbone=ViT-B/16, Zero-shot=true2025.12 | 48.1 | — | |
| CorrCLIPSize=ViT-H/14, Training Approach=Training-free2024.11 | 47.9 | — | |
| ZSSegBackbone=ViT-B/16, Training Dataset=COCO Stuff, Evaluation Setting=Cross-dataset, Prompt Engineering=Enabled2021.12 | 47.7 | — | |
| SimSegVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 47.7 | — | |
| ZSsegBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 47.7 | — | |
| ZSsegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 47.7 | — | |
| SCLIP + ARMBackbone=ViT-L/14, Zero-shot=true2025.12 | 46.9 | — | |
| LSeg+VL-Model=ALIGN EN-B7, Training Dataset=COCO, ensemble=no2023.02 | 46.5 | — |