Weakly Supervised Semantic Segmentation on PASCAL VOC 2012 (val)
78.4mIoUWeakTr
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| WeakTrBackbone=EVA-02-S, Pre-training=Large-scale2023.04 | 78.4 | — | |
| WeakTrBackbone=ViT-S, Pre-training=Large-scale2023.04 | 78 | — | |
| FFRBackbone=ViT-B, Pre-training=Large-scale2023.04 | 76.4 | — | |
| PCREBackbone=ViT-B, Pre-training=Large-scale2023.04 | 76.3 | — | |
| WeakTrBackbone=DINOv2-S, Pre-training=Large-scale2023.04 | 75.6 | — | |
| Ours (PPC-based)Supervision=I+S, Backbone=ResNet1012024.06 | 74.2 | — | |
| WeakTrBackbone=DeiT-S2023.04 | 74.2 | — | |
| DuPLBackbone=ViT-B, Pre-training=ImageNet-21k, WSSS Method Category=One-stage2024.03 | 74.1 | — | |
| DuPLBackbone=ViT-B, Pre-training=Large-scale2023.04 | 74.1 | — | |
| SeCoType=single-staged, Backbone=ViT-B/162024.02 | 74 | — | |
| DuPLBackbone=ViT-B, WSSS Method Category=One-stage2024.03 | 73.5 | — | |
| DuPLBackbone=DeiT-B2023.04 | 73.5 | — | |
| DIALBackbone=ViT-S, Pre-training=Large-scale2023.04 | 73.1 | — | |
| OCRType=multi-staged, Backbone=ResNet382024.02 | 72.7 | — | |
| PPCSupervision=I+S, Backbone=ResNet1012024.06 | 72.6 | — | |
| ACRSupervision=I, Backbone=ResNet382024.06 | 72.4 | — | |
| ToCoBackbone=ViT-B, Pre-training=Large-scale2023.04 | 72.3 | — | |
| RCASupervision=I+S, Backbone=ResNet382024.06 | 72.2 | — | |
| L2GType=multi-staged, Backbone=ResNet1012024.02 | 72.1 | — | |
| BECOSupervision=I, Backbone=ResNet382024.06 | 72.1 | — | |
| L2GSupervision=I+S, Backbone=ResNet1012024.06 | 72.1 | — | |
| MCTSupervision=I+S, Backbone=ResNet382024.06 | 71.9 | — | |
| Ours (AMN-based)Supervision=I, Backbone=ResNet1012024.06 | 71.8 | — | |
| RECAMSupervision=I+S, Backbone=ResNet1012024.06 | 71.8 | — | |
| SBCESupervision=I+S, Backbone=ResNet1012024.06 | 71.8 | — | |
| NSROM + ADELESupervision=Image-level labels + External saliency models, Backbone=ResNet-382021.10 | 71.6 | — | |
| URNBackbone=Res2Net-101, Supervision=I2021.12 | 71.2 | — | |
| ToCoType=single-staged, Backbone=ViT-B/162024.02 | 71.1 | — | |
| TOCOSupervision=I, Backbone=VIT-B2024.06 | 71.1 | — | |
| EDAMBackbone=ResNet-101, Supervision=Image-level tags + Saliency2022.03 | 70.9 | — | |
| AEFTSupervision=I, Backbone=ResNet382024.06 | 70.9 | — | |
| AdvCAM + W-OoDBackbone=WResNet-38, Supervision=Image-level tags2022.03 | 70.7 | — | |
| W-OODType=multi-staged, Backbone=ResNet382024.02 | 70.7 | — | |
| W-OODSupervision=I, Backbone=ResNet382024.06 | 70.7 | — | |
| AMNSupervision=I, Backbone=ResNet1012024.06 | 70.7 | — | |
| ToCoBackbone=ViT-B, WSSS Method Category=One-stage2024.03 | 70.5 | — | |
| ToCoBackbone=DeiT-B2023.04 | 70.5 | — | |
| NSROMBackbone=ResNet, Pre-trained on MS-COCO=true2021.03 | 70.4 | — | |
| NSROM*Supervision=Image-level labels + External saliency models, Backbone=ResNet-101, Pre-trained on MS-COCO=true2021.10 | 70.4 | — | |
| CLIMSType=multi-staged, Backbone=ResNet1012024.02 | 70.4 | — | |
| FPRType=multi-staged, Backbone=ResNet1012024.02 | 70.3 | — | |
| ViT-PCMType=single-staged, Backbone=ViT-B/162024.02 | 70.3 | — | |
| VIT-PCMSupervision=I, Backbone=ResNet1012024.06 | 70.3 | — | |
| DIALBackbone=DeiT-S2023.04 | 70.2 | — | |
| URNBackbone=ScaleNet-101, Supervision=I2021.12 | 70.1 | — | |
| PMMBackbone=Res2Net-101, Supervision=I2021.12 | 70 | — | |
| SBCESupervision=I, Backbone=ResNet1012024.06 | 70 | — | |
| PMMBackbone=Res2Net101, RW=false2021.08 | 70 | — | |
| AdvCAM + W-OoDBackbone=ResNet-101, Supervision=Image-level tags2022.03 | 69.8 | — | |
| URNBackbone=ResNet-101, Supervision=I2021.12 | 69.5 | — | |
| LIIDBackbone=Res2Net-101, Supervision=I+SOP2021.12 | 69.4 | — | |
| URNBackbone=ResNet-38, Supervision=I2021.12 | 69.4 | — | |
| SEAM + ADELESupervision=Image-level labels, Backbone=ResNet-382021.10 | 69.3 | — | |
| SLRNet distilled*Backbone=ResNet38, Supervision=Image labels (I), Training Stages=Multi-stage (DeeplabV3+ refinement)2022.03 | 69.3 | — | |
| AuxSegNetBackbone=WResNet-38, Supervision=Image-level tags + Saliency2022.03 | 69 | — | |
| Ours (SEAM-based)Supervision=I, Backbone=ResNet382024.06 | 68.9 | — | |
| SIPESupervision=I, Backbone=ResNet1012024.06 | 68.8 | — | |
| ICD + ADELESupervision=Image-level labels, Backbone=ResNet-382021.10 | 68.6 | — | |
| PMMBackbone=ResNet-38, Supervision=I2021.12 | 68.5 | — | |
| PMMBackbone=WResNet-38, Supervision=Image-level tags2022.03 | 68.5 | — | |
| PMMBackbone=ResNet38, RW=false2021.08 | 68.5 | — | |
| RECAMSupervision=I, Backbone=ResNet1012024.06 | 68.4 | — | |
| NSROMBackbone=ResNet, Pre-trained on MS-COCO=false2021.03 | 68.3 | — | |
| Yao et al.Backbone=ResNet-101, Supervision=Image-level tags + Saliency2022.03 | 68.3 | — | |
| A2GNNBackbone=ResNet-101, Supervision=Image-level tags + Saliency2022.03 | 68.3 | — | |
| CSEBackbone=WResNet-38, Supervision=Image-level tags2022.03 | 68.3 | — | |
| Li et al.Backbone=ResNet-101, Supervision=I+S2021.12 | 68.2 | — | |
| NSROMSupervision=Image-level labels + External saliency models, Backbone=ResNet-1012021.10 | 68.2 | — | |
| GSMType=multi-staged, Backbone=ResNet1012024.02 | 68.2 | — | |
| AdvCAMType=multi-staged, Backbone=ResNet1012024.02 | 68.1 | — | |
| ICDBackbone=ResNet, Publication=CVPR20, Pre-trained on MS-COCO=false2021.03 | 67.8 | — | |
| ICDBackbone=ResNet-101, Supervision=I+S2021.12 | 67.8 | — | |
| MCIS (ResNet)Backbone=ResNet, Training Data (Extra noisy web images/videos)=true2020.07 | 67.7 | — | |
| AdvCAMBackbone=ResNet-101, Supervision=Image-level tags, reproduced=true2022.03 | 67.5 | — | |
| OAABackbone=ResNet, Publication=ICCV19, Pre-trained on MS-COCO=true2021.03 | 67.4 | — | |
| Fan et al.Backbone=ResNet, Publication=ECCV20, Pre-trained on MS-COCO=false2021.03 | 67.2 | — | |
| SLRNetBackbone=ResNet38, Supervision=Image labels (I), Training Stages=Single-stage2022.03 | 67.2 | — | |
| PMMBackbone=ScaleNet-101, Supervision=I2021.12 | 67.1 | — | |
| SGANBackbone=ResNet-101, Supervision=I+S2021.12 | 67.1 | — | |
| PMMBackbone=ScaleNet101, RW=false2021.08 | 67.1 | — | |
| Zhang et al.Backbone=ResNet, Publication=ECCV20, Pre-trained on MS-COCO=false2021.03 | 66.6 | — | |
| SPLIT MERGESupervision=Image-level labels + External saliency models, Backbone=ResNet-502021.10 | 66.6 | — | |
| LIIDBackbone=ResNet-101, Supervision=I+SOP2021.12 | 66.5 | — | |
| AFABackbone=MiT-B1, WSSS Method Category=One-stage2024.03 | 66.5 | — | |
| AFABackbone=MiT-B12023.04 | 66.5 | — | |
| MCISBackbone=ResNet, Publication=ECCV20, Pre-trained on MS-COCO=false2021.03 | 66.2 | — | |
| Sun et al.Backbone=ResNet-101, Supervision=I2021.12 | 66.2 | — | |
| Sun et al.Backbone=ResNet-101, Supervision=Image-level tags + Saliency2022.03 | 66.2 | — | |
| MCISSupervision=Image-level labels + External saliency models, Backbone=ResNet-1012021.10 | 66.2 | — | |
| MCISBackbone=ResNet101, Supervision=Image labels (I), Saliency (S), Training Stages=Multi-stage2022.03 | 66.2 | — | |
| Sun et al.Backbone=ResNet101, RW=true2021.08 | 66.2 | — | |
| SCEBackbone=ResNet, Publication=CVPR20, Pre-trained on MS-COCO=false2021.03 | 66.1 | — | |
| CONTABackbone=ResNet, Publication=NIPS20, Pre-trained on MS-COCO=false2021.03 | 66.1 | — | |
| CONTABackbone=ResNet-38, Supervision=I2021.12 | 66.1 | — | |
| SC-CAMBackbone=ResNet-101, Supervision=I2021.12 | 66.1 | — | |
| Chang et al.Backbone=ResNet-101, Supervision=Image-level tags2022.03 | 66.1 | — | |
| CONTABackbone=WResNet-38, Supervision=Image-level tags2022.03 | 66.1 | — | |
| SCEBackbone=ResNet101, Supervision=Image labels (I), Training Stages=Multi-stage2022.03 | 66.1 | — | |
| CONTABackbone=ResNet38, Supervision=Image labels (I), Training Stages=Multi-stage2022.03 | 66.1 | — | |
| CDAType=multi-staged, Backbone=ResNet382024.02 | 66.1 | — |