Semantic Segmentation on VOC 2012 (val)
91.9mIoUFreeSeg
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| FreeSegTraining Source Dataset=COCO2023.03 | 91.9 | — | — | — | — | — | — | — | — | |
| ZSSegTraining Source Dataset=COCO2023.03 | 82.1 | — | — | — | — | — | — | — | — | |
| FreeSegTraining Source Dataset=ADE20K2023.03 | 80.1 | — | — | — | — | — | — | — | — | |
| ALiBi-Dv2Evaluation protocol=linear probe, Feature status=frozen2026.03 | 76.9 | — | — | — | — | — | — | — | — | |
| DINOv2Evaluation protocol=linear probe, Feature status=frozen2026.03 | 76.2 | — | — | — | — | — | — | — | — | |
| NoPEEvaluation protocol=linear probe, Feature status=frozen2026.03 | 75.7 | — | — | — | — | — | — | — | — | |
| Integer Training MethodModel=DeepLab-V12022.07 | 74.7 | — | — | — | — | — | — | — | — | |
| PseudoSegModel=DeepLabv3+, Network=ResNet-502020.10 | 73.8 | — | — | — | — | — | — | — | — | |
| DatasetDMTrain Set=DatasetDM, Architecture=Mask2former, Backbone=ResNet502023.08 | 73.6 | 77.9 | 72.9 | 70.1 | — | — | — | — | — | |
| CCTModel=PSP-Net, Network=ResNet-502020.10 | 73.2 | — | — | — | — | — | — | — | — | |
| MoCo-v2Data=IMN, Augmentation=heavy2021.11 | 72.4 | — | — | — | — | — | — | — | — | |
| RCA+EPSclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 72.2 | — | — | — | — | — | — | — | — | |
| CLIPTraining Source Dataset=COCO2023.03 | 71.6 | — | — | — | — | — | — | — | — | |
| RCA+OAA++classification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 71.1 | — | — | — | — | — | — | — | — | |
| EDAMclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 70.9 | — | — | — | — | — | — | — | — | |
| EPSclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 70.9 | — | — | — | — | — | — | — | — | |
| RCA+OAA++classification backbone=VGG16, segmentation backbone=ResNet2022.03 | 70.6 | — | — | — | — | — | — | — | — | |
| CrOCBackbone=ViT-S/16, Pre-training Dataset=ImageNet2023.03 | 70.6 | — | — | — | — | — | — | — | — | |
| DatasetDMSetting=Long-tail2023.08 | 70 | — | — | — | — | — | — | 73.1 | 66.4 | |
| Method [2]Model=DeepLab-V12022.07 | 69.9 | — | — | — | — | — | — | — | — | |
| SPMLclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 69.5 | — | — | — | — | — | — | — | — | |
| DiffuMaskTrain Set=DiffuMask, Architecture=Mask2former, Backbone=ResNet502023.08 | 69.5 | 74.2 | 71 | 63.2 | — | — | — | — | — | |
| ZSSegTraining Source Dataset=ADE20K2023.03 | 69.2 | — | — | — | — | — | — | — | — | |
| AuxSegNetclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 69 | — | — | — | — | — | — | — | — | |
| GroupWSSSclassification backbone=VGG16, segmentation backbone=ResNet2022.03 | 68.7 | — | — | — | — | — | — | — | — | |
| PMMclassification backbone=ResNet50, segmentation backbone=ResNet2022.03 | 68.5 | — | — | — | — | — | — | — | — | |
| NSROMclassification backbone=VGG16, segmentation backbone=ResNet2022.03 | 68.3 | — | — | — | — | — | — | — | — | |
| OAA++classification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 68.1 | — | — | — | — | — | — | — | — | |
| ADE20KTrain Set=ADE20K, Architecture=Mask2former, Backbone=ResNet502023.08 | 68 | 73.2 | 66.6 | 64.1 | — | — | — | — | — | |
| ICDclassification backbone=VGG16, segmentation backbone=ResNet2022.03 | 67.8 | — | — | — | — | — | — | — | — | |
| CPNclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 67.8 | — | — | — | — | — | — | — | — | |
| OAA++classification backbone=VGG16, segmentation backbone=ResNet2022.03 | 67.7 | — | — | — | — | — | — | — | — | |
| CLIPTraining Source Dataset=ADE20K2023.03 | 67.1 | — | — | — | — | — | — | — | — | |
| MCISclassification backbone=VGG16, segmentation backbone=ResNet2022.03 | 66.2 | — | — | — | — | — | — | — | — | |
| SubCatclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 66.1 | — | — | — | — | — | — | — | — | |
| CONTAclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 66.1 | — | — | — | — | — | — | — | — | |
| GANSegModel=FCN, Network=VGG162020.10 | 65.8 | — | — | — | — | — | — | — | — | |
| FickleNetModel=DeepLabv2, Network=ResNet-1012020.10 | 65.8 | — | — | — | — | — | — | — | — | |
| MDCModel=DeepLab-CRF-LFOV, Network=VGG162020.10 | 65.7 | — | — | — | — | — | — | — | — | |
| BESclassification backbone=ResNet50, segmentation backbone=ResNet2022.03 | 65.7 | — | — | — | — | — | — | — | — | |
| OAA+classification backbone=VGG16, segmentation backbone=ResNet2022.03 | 65.2 | — | — | — | — | — | — | — | — | |
| FickleNetclassification backbone=VGG16, segmentation backbone=ResNet2022.03 | 64.9 | — | — | — | — | — | — | — | — | |
| SSDDclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 64.9 | — | — | — | — | — | — | — | — | |
| WSSNModel=DeepLab-CRF, Network=VGG162020.10 | 64.6 | — | — | — | — | — | — | — | — | |
| SEAMclassification backbone=ResNet38, segmentation backbone=ResNet2022.03 | 64.5 | — | — | — | — | — | — | — | — | |
| DSRGModel=DeepLabv2, Network=VGG162020.10 | 64.3 | — | — | — | — | — | — | — | — | |
| CIANclassification backbone=VGG16, segmentation backbone=ResNet2022.03 | 64.3 | — | — | — | — | — | — | — | — | |
| RNetclassification backbone=ResNet50, segmentation backbone=ResNet2022.03 | 63.5 | — | — | — | — | — | — | — | — | |
| SSNetclassification backbone=ResNet50, segmentation backbone=ResNet2022.03 | 63.3 | — | — | — | — | — | — | — | — | |
| CP2Backbone=ViT-S/16, Pre-training Dataset=ImageNet + PVOC122023.03 | 63.1 | — | — | — | — | — | — | — | — | |
| MoCo-v2Data=YTB, Augmentation=heavy2021.11 | 62.8 | — | — | — | — | — | — | — | — | |
| AMDData=YTB, Augmentation=heavy2021.11 | 62.1 | — | — | — | — | — | — | — | — | |
| AMDData=YTB, Augmentation=light2021.11 | 62 | — | — | — | — | — | — | — | — | |
| MoCo-v2Data=YTB, Augmentation=light2021.11 | 61.5 | — | — | — | — | — | — | — | — | |
| CrOCBackbone=ViT-S/16, Pre-training Dataset=COCO+2023.03 | 60.6 | — | — | — | — | — | — | — | — | |
| GAINModel=DeepLab-CRF-LFOV, Network=VGG162020.10 | 60.5 | — | — | — | — | — | — | — | — | |
| VICRegLBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 58.9 | — | — | — | — | — | — | — | — | |
| DenseCLBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 57.9 | — | — | — | — | — | — | — | — | |
| PixProBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 57.1 | — | — | — | — | — | — | — | — | |
| ReSimBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 55.1 | — | — | — | — | — | — | — | — | |
| ViT-S/16 (+LazyStrike)Backbone=ViT-S/16, Train=DINO2026.02 | 55.1 | — | — | — | — | — | — | — | — | |
| CrOCBackbone=ViT-S/16, Pre-training Dataset=COCO2023.03 | 54.5 | — | — | — | — | — | — | — | — | |
| SoCoBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 54 | — | — | — | — | — | — | — | — | |
| TimeCycleData=VLOG, Augmentation=light2021.11 | 52.8 | — | — | — | — | — | — | — | — | |
| Baseline (no Syn.)Synthetic Data=None2023.08 | 52.6 | — | — | — | — | — | — | 61.2 | 44.1 | |
| ScratchData=None, Augmentation=None2021.11 | 48 | — | — | — | — | — | — | — | — | |
| ViT-S/16Backbone=ViT-S/16, Train=DINO2026.02 | 47.7 | — | — | — | — | — | — | — | — | |
| DINOBackbone=ViT-S/16, Pre-training Dataset=COCO2023.03 | 47.2 | — | — | — | — | — | — | — | — | |
| ORLBackbone=ResNet50, Pre-training Dataset=COCO+2023.03 | 45.2 | — | — | — | — | — | — | — | — | |
| ViT-S/16 (+LazyStrike)Backbone=ViT-S/16, Train=Supervised2026.02 | 41.9 | — | — | — | — | — | — | — | — | |
| BYOLBackbone=ResNet50, Pre-training Dataset=COCO+2023.03 | 38.7 | — | — | — | — | — | — | — | — | |
| ViT-B/16 (+LazyStrike)Backbone=ViT-B/16, Train=Supervised2026.02 | 32.8 | — | — | — | — | — | — | — | — | |
| MAEBackbone=ViT-S/16, Pre-training Dataset=COCO2023.03 | 31.7 | — | — | — | — | — | — | — | — | |
| ViT-S/16Backbone=ViT-S/16, Train=Supervised2026.02 | 29.5 | — | — | — | — | — | — | — | — | |
| CityscapesTrain Set=Cityscapes, Architecture=Mask2former, Backbone=ResNet502023.08 | 29.2 | 26.4 | 32.9 | 28.3 | — | — | — | — | — | |
| ViT-B/16Backbone=ViT-B/16, Train=Supervised2026.02 | 22.3 | — | — | — | — | — | — | — | — | |
| Baseline (no Syn.)Synthetic Data=None2023.08 | — | — | — | — | 61.3 | 10.7 | 18.3 | — | — | |
| DatasetDMSetting=Zero Shot2023.08 | — | — | — | — | 78.8 | 60.5 | 68.4 | — | — | |
| DiffuMask2023.08 | — | — | — | — | 71.4 | 65 | 68.1 | — | — | |
| Li et al.2023.08 | — | — | — | — | 62.8 | 50 | 55.7 | — | — |