Weakly Supervised Semantic Segmentation on PASCAL VOC 2012 (train)
80.3mIoUWeakTr
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| WeakTrBackbone=ViT-S, Pre-training=Large-scale2023.04 | 80.3 | — | — | — | — | — | — | — | — | |
| WeakTrBackbone=EVA-02-S, Pre-training=Large-scale2023.04 | 80 | — | — | — | — | — | — | — | — | |
| POTBackbone=CLIP-ViT-B, Pre-training=Large-scale2023.04 | 79.3 | — | — | — | — | — | — | — | — | |
| DiCLIP (Ours-Med)Training Category=Training-required, Type=Single-staged, Supervision=Image + Language, Backbone=ViT-B2026.05 | 78.2 | — | — | — | — | — | — | — | — | |
| DiCLIP (Ours-Med)Stage=Single-stage, Supervision=Image + Language, Backbone=ViT-B2026.05 | 78.2 | — | — | — | — | — | — | — | — | |
| DiCLIP (Ours-Med)Type=S, Supervision=I + L, Backbone=ViT-B2026.05 | 78.2 | — | — | — | — | — | — | — | — | |
| WeakTrBackbone=DINOv2-S, Pre-training=Large-scale2023.04 | 78.1 | — | — | — | — | — | — | — | — | |
| PCREBackbone=ViT-B, Pre-training=Large-scale2023.04 | 77.6 | — | — | — | — | — | — | — | — | |
| MoReTraining Category=Training-required, Type=Single-staged, Supervision=Image-level, Backbone=ViT-B2026.05 | 77 | — | — | — | — | — | — | — | — | |
| MoReStage=Single-stage, Supervision=Image-level, Backbone=ViT-B2026.05 | 77 | — | — | — | — | — | — | — | — | |
| MoReType=S, Supervision=I, Backbone=ViT-B2026.05 | 77 | — | — | — | — | — | — | — | — | |
| WeakTrBackbone=DeiT-S2023.04 | 76.5 | — | — | — | — | — | — | — | — | |
| DuPLBackbone=ViT-B, Pre-training=ImageNet-21k, WSSS Method Category=One-stage2024.03 | 76 | — | — | — | — | — | — | — | — | |
| DuPLBackbone=ViT-B, Pre-training=Large-scale2023.04 | 76 | — | — | — | — | — | — | — | — | |
| WeCLIPTraining Category=Training-required, Type=Single-staged, Supervision=Image + Language, Backbone=ViT-B, reproduced=true2026.05 | 75.4 | — | — | — | — | — | — | — | — | |
| WeCLIPStage=Single-stage, Supervision=Image + Language, Backbone=ViT-B2026.05 | 75.4 | — | — | — | — | — | — | — | — | |
| †WeCLIPType=S, Supervision=I + L, Backbone=ViT-B2026.05 | 75.4 | — | — | — | — | — | — | — | — | |
| DIALBackbone=ViT-S, Pre-training=Large-scale2023.04 | 75.2 | — | — | — | — | — | — | — | — | |
| DIALTraining Category=Training-required, Type=Single-staged, Supervision=Image + Language, Backbone=ViT-B2026.05 | 75.2 | — | — | — | — | — | — | — | — | |
| DIALStage=Single-stage, Supervision=Image + Language, Backbone=ViT-B2026.05 | 75.2 | — | — | — | — | — | — | — | — | |
| DIALType=S, Supervision=I + L, Backbone=ViT-B2026.05 | 75.2 | — | — | — | — | — | — | — | — | |
| DuPLBackbone=ViT-B, WSSS Method Category=One-stage2024.03 | 75.1 | — | — | — | — | — | — | — | — | |
| DuPLBackbone=DeiT-B2023.04 | 75.1 | — | — | — | — | — | — | — | — | |
| CLIP-ESBackbone=CLIP-ViT-B, Pre-training=Large-scale2023.04 | 75 | — | — | — | — | — | — | — | — | |
| DuPLTraining Category=Training-required, Type=Single-staged, Supervision=Image-level, Backbone=ViT-B, reproduced=true2026.05 | 75 | — | — | — | — | — | — | — | — | |
| POTTraining Category=Training-required, Type=Single-staged, Supervision=Image + Language, Backbone=ViT-B2026.05 | 75 | — | — | — | — | — | — | — | — | |
| DuPLStage=Single-stage, Supervision=Image-level, Backbone=ViT-B2026.05 | 75 | — | — | — | — | — | — | — | — | |
| POTStage=Single-stage, Supervision=Image + Language, Backbone=ViT-B2026.05 | 75 | — | — | — | — | — | — | — | — | |
| †DuPLType=S, Supervision=I, Backbone=ViT-B2026.05 | 75 | — | — | — | — | — | — | — | — | |
| POTType=S, Supervision=I + L, Backbone=ViT-B2026.05 | 75 | — | — | — | — | — | — | — | — | |
| PCCBackbone=ViT-B, Pre-training=Large-scale2023.04 | 74.8 | — | — | — | — | — | — | — | — | |
| SeCoTraining Category=Training-required, Type=Single-staged, Supervision=Image-level, Backbone=ViT-B2026.05 | 74.8 | — | — | — | — | — | — | — | — | |
| SeCoStage=Single-stage, Supervision=Image-level, Backbone=ViT-B2026.05 | 74.8 | — | — | — | — | — | — | — | — | |
| SeCoType=S, Supervision=I, Backbone=ViT-B2026.05 | 74.8 | — | — | — | — | — | — | — | — | |
| DiGBackbone=DeiT-S2023.04 | 74.3 | — | — | — | — | — | — | — | — | |
| MuP-VSSBackbone=DeiT-S2023.04 | 74.1 | — | — | — | — | — | — | — | — | |
| DiCLIP (Mes)Training Category=Training-free, Type=Single-staged, Supervision=Image + Language, Backbone=ViT-B2026.05 | 74 | — | — | — | — | — | — | — | — | |
| DiCLIP (Mes)Stage=Single-stage, Supervision=Image + Language, Backbone=ViT-B2026.05 | 74 | — | — | — | — | — | — | — | — | |
| DiCLIP (Mes)Type=S, Supervision=I + L, Backbone=ViT-B2026.05 | 74 | — | — | — | — | — | — | — | — | |
| KTSEBackbone=ResNet382023.04 | 73.8 | — | — | — | — | — | — | — | — | |
| SFCBackbone=ResNet502023.04 | 73.7 | — | — | — | — | — | — | — | — | |
| CTIBackbone=DeiT-S2023.04 | 73.7 | — | — | — | — | — | — | — | — | |
| WeakCLIPTraining Category=Training-required, Type=Multi-staged, Supervision=Image + Language, Backbone=ViT-B, reproduced=true2026.05 | 73.7 | — | — | — | — | — | — | — | — | |
| WeakCLIPStage=Multi-staged, Supervision=Image + Language, Backbone=ViT-B2026.05 | 73.7 | — | — | — | — | — | — | — | — | |
| †WeakCLIPType=M, Supervision=I + L, Backbone=ViT-B2026.05 | 73.7 | — | — | — | — | — | — | — | — | |
| ToCoBackbone=ViT-B, Pre-training=Large-scale2023.04 | 73.6 | — | — | — | — | — | — | — | — | |
| PPC + PSABackbone=WR38, WSSS Method Category=Multi-stage2024.03 | 73.3 | — | — | — | — | — | — | — | — | |
| PCSSBackbone=DeiT-S2023.04 | 73.2 | — | — | — | — | — | — | — | — | |
| ACR + IRNBackbone=WR38, WSSS Method Category=Multi-stage2024.03 | 72.3 | — | — | — | — | — | — | — | — | |
| ToCoBackbone=ViT-B, WSSS Method Category=One-stage2024.03 | 72.2 | — | — | — | — | — | — | — | — | |
| ToCoBackbone=DeiT-B2023.04 | 72.2 | — | — | — | — | — | — | — | — | |
| DiCLIP (Mt)Training Category=Training-free, Type=Single-staged, Supervision=Image + Language, Backbone=ViT-B2026.05 | 72 | — | — | — | — | — | — | — | — | |
| DiCLIP (Mt)Stage=Single-stage, Supervision=Image + Language, Backbone=ViT-B2026.05 | 72 | — | — | — | — | — | — | — | — | |
| DiCLIP (Mt)Type=S, Supervision=I + L, Backbone=ViT-B2026.05 | 72 | — | — | — | — | — | — | — | — | |
| DIALBackbone=DeiT-S2023.04 | 71.9 | — | — | — | — | — | — | — | — | |
| CPALTraining Category=Training-required, Type=Multi-staged, Supervision=Image + Language, Backbone=ViT-B2026.05 | 71.9 | — | — | — | — | — | — | — | — | |
| CPALStage=Multi-staged, Supervision=Image + Language, Backbone=ViT-B2026.05 | 71.9 | — | — | — | — | — | — | — | — | |
| CPALType=M, Supervision=I + L, Backbone=ViT-B2026.05 | 71.9 | — | — | — | — | — | — | — | — | |
| MuP-VSSTraining Category=Training-required, Type=Multi-staged, Supervision=Image-level, Backbone=ViT-B2026.05 | 71.7 | — | — | — | — | — | — | — | — | |
| MuP-VSSStage=Multi-staged, Supervision=Image-level, Backbone=ViT-B2026.05 | 71.7 | — | — | — | — | — | — | — | — | |
| MuP-VSSType=M, Supervision=I, Backbone=ViT-B2026.05 | 71.7 | — | — | — | — | — | — | — | — | |
| ToCoTraining Category=Training-required, Type=Single-staged, Supervision=Image-level, Backbone=ViT-B, reproduced=true2026.05 | 71.6 | — | — | — | — | — | — | — | — | |
| ToCoStage=Single-stage, Supervision=Image-level, Backbone=ViT-B2026.05 | 71.6 | — | — | — | — | — | — | — | — | |
| †ToCoType=S, Supervision=I, Backbone=ViT-B2026.05 | 71.6 | — | — | — | — | — | — | — | — | |
| VWEBackbone=ResNet1012023.04 | 71.4 | — | — | — | — | — | — | — | — | |
| Yoon et al.Backbone=ResNet382023.04 | 71 | — | — | — | — | — | — | — | — | |
| ACRBackbone=DeiT-S2023.04 | 70.9 | — | — | — | — | — | — | — | — | |
| CLIP-ESTraining Category=Training-free, Type=Single-staged, Supervision=Image + Language, Backbone=ViT-B2026.05 | 70.8 | — | — | — | — | — | — | — | — | |
| CLIP-ESStage=Single-stage, Supervision=Image + Language, Backbone=ViT-B2026.05 | 70.8 | — | — | — | — | — | — | — | — | |
| CLIP-ESType=S, Supervision=I + L, Backbone=ViT-B2026.05 | 70.8 | — | — | — | — | — | — | — | — | |
| CLIMSBackbone=ResNet502023.04 | 70.5 | — | — | — | — | — | — | — | — | |
| DiffsegmenterTraining Category=Training-free, Type=Single-staged, Supervision=Image-level, Backbone=SD2026.05 | 70.5 | — | — | — | — | — | — | — | — | |
| DiffsegmenterStage=Single-stage, Supervision=Image-level, Backbone=SD2026.05 | 70.5 | — | — | — | — | — | — | — | — | |
| DiffsegmenterType=S, Supervision=I, Backbone=SD2026.05 | 70.5 | — | — | — | — | — | — | — | — | |
| AdvCAMBackbone=ResNet502023.04 | 69.9 | — | — | — | — | — | — | — | — | |
| CTITraining Category=Training-required, Type=Multi-staged, Supervision=Image-level, Backbone=RN1012026.05 | 69.5 | — | — | — | — | — | — | — | — | |
| CTIStage=Multi-staged, Supervision=Image-level, Backbone=RN1012026.05 | 69.5 | — | — | — | — | — | — | — | — | |
| CTIType=M, Supervision=I, Backbone=RN1012026.05 | 69.5 | — | — | — | — | — | — | — | — | |
| DiGTraining Category=Training-required, Type=Multi-staged, Supervision=Image-level, Backbone=DiT-S2026.05 | 69.3 | — | — | — | — | — | — | — | — | |
| DiGStage=Multi-staged, Supervision=Image-level, Backbone=DiT-S2026.05 | 69.3 | — | — | — | — | — | — | — | — | |
| DiGType=M, Supervision=I, Backbone=DiT-S2026.05 | 69.3 | — | — | — | — | — | — | — | — | |
| MCTformerBackbone=DeiT-S2023.04 | 69.1 | — | — | — | — | — | — | — | — | |
| MCTformer+Training Category=Training-required, Type=Multi-staged, Supervision=Image-level, Backbone=RN382026.05 | 68.8 | — | — | — | — | — | — | — | — | |
| MCTformer+Stage=Multi-staged, Supervision=Image-level, Backbone=RN382026.05 | 68.8 | — | — | — | — | — | — | — | — | |
| MCTformer+Type=M, Supervision=I, Backbone=RN382026.05 | 68.8 | — | — | — | — | — | — | — | — | |
| AFABackbone=MiT-B1, WSSS Method Category=One-stage2024.03 | 68.7 | — | — | — | — | — | — | — | — | |
| AFABackbone=MiT-B12023.04 | 68.7 | — | — | — | — | — | — | — | — | |
| CONTABackbone=ResNet382023.04 | 67.9 | — | — | — | — | — | — | — | — | |
| ECS-NetBackbone=ResNet382023.04 | 67.8 | — | — | — | — | — | — | — | — | |
| ViT-PCMBackbone=ViT-B, Pre-training=ImageNet-21k, WSSS Method Category=One-stage2024.03 | 67.7 | — | — | — | — | — | — | — | — | |
| ViT-PCMBackbone=ViT-B, Pre-training=Large-scale2023.04 | 67.7 | — | — | — | — | — | — | — | — | |
| ViT-PCMTraining Category=Training-required, Type=Single-staged, Supervision=Image-level, Backbone=ViT-B2026.05 | 67.7 | — | — | — | — | — | — | — | — | |
| ViT-PCMStage=Single-stage, Supervision=Image-level, Backbone=ViT-B2026.05 | 67.7 | — | — | — | — | — | — | — | — | |
| ViT-PCMType=S, Supervision=I, Backbone=ViT-B2026.05 | 67.7 | — | — | — | — | — | — | — | — | |
| BESBackbone=ResNet502023.04 | 67.2 | — | — | — | — | — | — | — | — | |
| 1StageBackbone=WR38, WSSS Method Category=One-stage2024.03 | 66.9 | — | — | — | — | — | — | — | — | |
| OC-CSEBackbone=ResNet382023.04 | 66.9 | — | — | — | — | — | — | — | — | |
| AFATraining Category=Training-required, Type=Single-staged, Supervision=Image-level, Backbone=MiT-B12026.05 | 65 | — | — | — | — | — | — | — | — | |
| AFAStage=Single-stage, Supervision=Image-level, Backbone=MiT-B12026.05 | 65 | — | — | — | — | — | — | — | — | |
| AFAType=S, Supervision=I, Backbone=MiT-B12026.05 | 65 | — | — | — | — | — | — | — | — |