Semantic Segmentation on Pascal Context 459
42.4mIoUSELF1E-2B
Evaluation Results
| Method | Links | |
|---|---|---|
| SELF1E-2Btrained on corresponding datasets=true2026.03 | 42.4 | |
| PCA-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 26.7 | |
| CAT-Seg+DeCLIPBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 25.9 | |
| DeCLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 25.9 | |
| LSMSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 25.6 | |
| LLMFormerBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 25.4 | |
| H-CLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 24.2 | |
| CAT-SegBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 23.8 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 23.8 | |
| CAT-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 23.8 | |
| DPSegVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 23.5 | |
| MaskAdapterVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 22.7 | |
| Mask-AdapterBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 22.7 | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff2024.11 | 22.6 | |
| SEDBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 22.6 | |
| PCA-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 22.3 | |
| MAFT+VLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 21.6 | |
| CAT-Seg+DeCLIPBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 21.4 | |
| DeCLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 21.4 | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 21 | |
| EBSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 21 | |
| LSMSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 20.3 | |
| FrozenSegBackbone=ConvNeXt-L, Training Set=COCO-Panoptic2025.05 | 19.7 | |
| H-CLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 19.4 | |
| CAT-SegBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 19 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 19 | |
| CAT-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 19 | |
| SELF1E-2B*zero-shot=true, trained on corresponding datasets=false2026.03 | 18.9 | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff2024.11 | 18.6 | |
| SEDBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 18.6 | |
| FC-CLIPBackbone=ConvNeXt-L, Training Set=COCO-Panoptic2025.05 | 18.2 | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic2024.11 | 18.2 | |
| Mask-AdapterBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 17.9 | |
| MaskFormerbackbone=R-101c, training dataset=Same as test2022.10 | 17.4 | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 17.3 | |
| EBSegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 17.3 | |
| SANBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 17.1 | |
| MAFTBackbone=ConvNeXt-L, Training Set=COCO-Stuff2025.05 | 17 | |
| SCANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 16.7 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 15.7 | |
| ODISETraining Dataset=COCO, Supervision: label=true, Supervision: mask=true, Supervision: caption=false2023.03 | 14.5 | |
| ODISEBackbone=ViT-L/14, Training Set=COCO-Panoptic2025.05 | 14.5 | |
| ODISEVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 14.5 | |
| ODISEBackbone=ViT-L/14, Training Dataset=COCO-Panoptic2026.03 | 14.5 | |
| ODISETraining Dataset=COCO, Supervision: label=false, Supervision: mask=false, Supervision: caption=true2023.03 | 13.8 | |
| ODISEBackbone=UNet+M2F, Training data=LAION+CLIP+COCO2023.06 | 13.8 | |
| SCANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 13.2 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 12.6 | |
| OVSegbackbone=Swin-B, training dataset=COCO-Stuff-1712022.10 | 12.4 | |
| OVSegBackbone=Swin-B, Training data=COCO stuff+cap2023.06 | 12.4 | |
| OVSegBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 12.4 | |
| OVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 12.4 | |
| OVSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff + Caption2026.03 | 12.4 | |
| DaTaSegBackbone=ViTDet-B, Training data=COCO panoptic + ADE semantic2023.06 | 11.6 | |
| OpenSegBackbone=Eff-b7, Training data=COCO+Loc. Narr.2023.06 | 11.5 | |
| OpenSegVLM=ALIGN EN-B7, Training Dataset=COCO Panoptic2024.11 | 11.5 | |
| DaTaSegBackbone=R-50, Training data=COCO panoptic2023.06 | 11.1 | |
| DaTaSegBackbone=ViTDet-L, Training data=COCO panoptic + ADE semantic + O365 bbox2023.06 | 11.1 | |
| OVSegbackbone=R-101c, training dataset=COCO-Stuff-1712022.10 | 11 | |
| OVSegBackbone=R-101c, Training data=COCO stuff+cap2023.06 | 11 | |
| OVSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 11 | |
| OVSegBackbone=ViT-B/16, Training Dataset=COCO-Stuff + Caption2026.03 | 11 | |
| OVSegbackbone=R-101c, training dataset=COCO-Stuff-1562022.10 | 10.4 | |
| ZegFormer+Backbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 10.4 | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.11 | 10.4 | |
| SimSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.11 | 10.2 | |
| PSALM2026.03 | 10.2 | |
| MaskCLIPTraining Dataset=COCO, Supervision: label=true, Supervision: mask=false, Supervision: caption=false2023.03 | 10 | |
| MaskCLIPBackbone=R-50, Training data=COCO pan+CLIP2023.06 | 10 | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff-1562024.11 | 9.4 | |
| ZegFormerBackbone=ViT-B/16, Training Dataset=COCO-Stuff-1562026.03 | 9.1 | |
| OpenSegbackbone=Eff-B7, training dataset=COCO Panoptic2022.10 | 9 | |
| OpenSegTraining Dataset=COCO, Supervision: label=false, Supervision: mask=false, Supervision: caption=true2023.03 | 9 | |
| OpenSegBackbone=R-101, Training data=COCO pan+cap2023.06 | 9 | |
| LSeg+backbone=Eff-B7, training dataset=COCO Panoptic2022.10 | 7.8 | |
| LSeg+Training Dataset=COCO, Supervision: label=true, Supervision: mask=true, Supervision: caption=false2023.03 | 7.8 | |
| Lseg+VLM=ALIGN EN-B7, Training Dataset=COCO-Stuff2024.11 | 7.8 | |
| GKCBackbone=ViT-B/16, Training Dataset=COCO Panoptic2026.03 | 7.1 | |
| OpenSegbackbone=R-101, training dataset=COCO Panoptic2022.10 | 6.5 | |
| LSeg+backbone=R-101, training dataset=COCO Panoptic2022.10 | 5.2 | |
| LSeg+Backbone=ALIGN, Training Dataset=COCO-Stuff2026.03 | 5.2 | |
| GroupViTTraining Dataset=GCC+YFCC, Supervision: label=false, Supervision: mask=false, Supervision: caption=true2023.03 | 4.9 |