Semantic Segmentation on COCO 2014 (val)
61.8mIoUFSSS
Evaluation Results
| Method | Links | |
|---|---|---|
| FSSSBackbone=ResNet-101, Supervision=F2023.04 | 61.8 | |
| ModuSegTrain status=Training-Free, Method category=Multi-stage2026.04 | 56.7 | |
| SemPLeS2024.01 | 56.1 | |
| FMA-WSSS2024.01 | 55.4 | |
| G-RAM-SAM2024.01 | 54.6 | |
| AttentionShots=5, Multi-scale (MS)=true2019.03 | 51.6 | |
| WeakTrBackbone=EVA-02-S, Sup.=I, large-scale datasets=true2023.04 | 51.1 | |
| SSRTrain status=Required, Method category=Single-stage2026.04 | 50.6 | |
| UniMatch* + S4MCBackbone=Xception-65, Partition protocol=1/32 (3697)2023.08 | 50.58 | |
| WeakTrBackbone=ViT-S, Sup.=I, large-scale datasets=true2023.04 | 50.3 | |
| ExCELTrain status=Required, Method category=Single-stage2026.04 | 50.3 | |
| CANetShots=1, Multi-scale (MS)=true2019.03 | 49.9 | |
| UniMatch*Backbone=Xception-65, Partition protocol=1/32 (3697)2023.08 | 49.8 | |
| S2CTrain status=Required, Method category=Multi-stage2026.04 | 49.8 | |
| VPLTrain status=Required, Method category=Multi-stage2026.04 | 49.8 | |
| AttentionShots=5, Multi-scale (MS)=false2019.03 | 49.7 | |
| MARSBackbone=ResNet-101, Supervision=I2023.04 | 49.4 | |
| Mask-AvgShots=5, Multi-scale (MS)=false2019.03 | 49.2 | |
| Feature-AvgShots=5, Multi-scale (MS)=false2019.03 | 48.9 | |
| WeakTrBackbone=DINOv2-S, Sup.=I, large-scale datasets=true2023.04 | 48.9 | |
| UniMatch* + S4MCBackbone=Xception-65, Partition protocol=1/64 (1849)2023.08 | 47.98 | |
| POTBackbone=ResNet101, Sup.=I + L, large-scale datasets=false2023.04 | 47.9 | |
| POTTrain status=Required, Method category=Multi-stage2026.04 | 47.9 | |
| UniMatch*Backbone=Xception-65, Partition protocol=1/64 (1849)2023.08 | 47.8 | |
| OTPLTrain status=Required, Method category=Multi-stage2026.04 | 47.6 | |
| MoReTrain status=Required, Method category=Single-stage2026.04 | 47.4 | |
| WeakCLIPTrain status=Required, Method category=Multi-stage2026.04 | 47.4 | |
| PCREBackbone=ViT-B, Sup.=I, large-scale datasets=true2023.04 | 47.2 | |
| PCRETrain status=Required, Method category=Single-stage2026.04 | 47.2 | |
| WeCLIPBackbone=ViT, Supervision=I+L, Stage=single-stage weakly supervised, CRF=true2024.06 | 47.1 | |
| WeCLIPBackbone=CLIP-ViT-B, Sup.=I + L, large-scale datasets=true2023.04 | 47.1 | |
| WeCLIPTrain status=Required, Method category=Single-stage2026.04 | 47.1 | |
| WeakTrBackbone=DeiT-S, Sup.=I, large-scale datasets=false2023.04 | 46.9 | |
| CM-GLasso2026.04 | 46.82 | |
| SFCBackbone=ResNet101, Supervision=Image-level supervision only2024.01 | 46.8 | |
| SFCBackbone=ResNet101, Sup.=I, large-scale datasets=false2023.04 | 46.8 | |
| FFRBackbone=ViT-B, Sup.=I, large-scale datasets=true2023.04 | 46.8 | |
| CPALTrain status=Required, Method category=Multi-stage2026.04 | 46.8 | |
| SeCoType=single-staged, Backbone=ViT-B/16, Supervision=image labels2024.02 | 46.7 | |
| MuP-VSSBackbone=ResNet38, Sup.=I, large-scale datasets=false2023.04 | 46.6 | |
| MulP-VSS2026.04 | 46.6 | |
| RS+EPMBackbone=ResNet-101, Supervision=I2023.04 | 46.4 | |
| RSEPMBackbone=R101, Supervision=I, Framework=Multi-stage2022.04 | 46.4 | |
| WeCLIPBackbone=ViT, Supervision=I+L, Stage=single-stage weakly supervised, CRF=false2024.06 | 46.4 | |
| CANetShots=1, Multi-scale (MS)=false2019.03 | 46.3 | |
| Mask-ORShots=5, Multi-scale (MS)=false2019.03 | 46.2 | |
| PC2SegBackbone=Xception-65, Partition protocol=1/32 (3697)2023.08 | 46.1 | |
| KTSEBackbone=ResNet101, Sup.=I, large-scale datasets=false2023.04 | 45.9 | |
| RSBackbone=R101, Supervision=I, Framework=Multi-stage2022.04 | 45.8 | |
| Text2MaskBackbone=R101, Supervision=I+L (Image and Language)2023.09 | 45.7 | |
| PCSSBackbone=ResNet101, Sup.=I, large-scale datasets=false2023.04 | 45.7 | |
| FBR (AMN-based)Sup.=I, Backbone=ResNet1012024.06 | 45.6 | |
| CDLBackbone=ResNet101, Supervision=I, Stage=multi-stage weakly supervised2024.06 | 45.5 | |
| DiGBackbone=ResNet38, Sup.=I, large-scale datasets=false2023.04 | 45.5 | |
| CLIP-ESBackbone=ResNet-101, Segmentation Network=DeepLabV2, Supervision Type=Image-level + Language supervision (I+L)2022.12 | 45.4 | |
| CLIP-ESType=multi-staged, Backbone=ResNet101, Supervision=image labels + external data2024.02 | 45.4 | |
| CLIP-ESBackbone=ViT+Res101, Supervision=I+L, Stage=multi-stage weakly supervised2024.06 | 45.4 | |
| CLIP-ESBackbone=R101, Supervision=I+L (Image and Language)2023.09 | 45.4 | |
| CPF-CTEBackbone=ViT-B/162026.01 | 45.4 | |
| CLIP-ESBackbone=ResNet101, Sup.=I + L, large-scale datasets=false2023.04 | 45.4 | |
| CTIBackbone=ResNet101, Sup.=I, large-scale datasets=false2023.04 | 45.4 | |
| CLIP-ES2026.04 | 45.4 | |
| CLIP-ESTrain status=Required, Method category=Multi-stage2026.04 | 45.4 | |
| ACRBackbone=WR38, Supervision=I, Framework=Multi-stage2022.04 | 45.3 | |
| ACRBackbone=ResNet38, Supervision=I, Stage=multi-stage weakly supervised2024.06 | 45.3 | |
| ACRSup.=I, Backbone=ResNet382024.06 | 45.3 | |
| ACRBackbone=ResNet38, Sup.=I, large-scale datasets=false2023.04 | 45.3 | |
| MCTformer+Train status=Required, Method category=Multi-stage2026.04 | 45.2 | |
| BECOBackbone=ViT, Supervision=I, Stage=multi-stage weakly supervised2024.06 | 45.1 | |
| BECOSup.=I, Backbone=ResNet1012024.06 | 45.1 | |
| BECOBackbone=ResNet101, Sup.=I, large-scale datasets=false2023.04 | 45.1 | |
| BECO2026.04 | 45.1 | |
| RECAMSup.=I, Backbone=ResNet1012024.06 | 45 | |
| ViT-PCMSup.=I, Backbone=ViT-B/162024.06 | 45 | |
| ViT-PCMBackbone=ResNet101, Sup.=I, large-scale datasets=false2023.04 | 45 | |
| AEFTSup.=I, Backbone=ResNet382024.06 | 44.8 | |
| Yoon et al.Backbone=ResNet38, Sup.=I, large-scale datasets=false2023.04 | 44.8 | |
| AMNBackbone=ResNet101, Supervision=I., Pre-training=ImageNet2022.03 | 44.7 | |
| AMNBackbone=ResNet-101, Segmentation Network=DeepLabV2, Supervision Type=Image-level (I)2022.12 | 44.7 | |
| AMNBackbone=ResNet-101, Supervision=I2023.04 | 44.7 | |
| SANCEBackbone=ResNet-50, Supervision=I2023.04 | 44.7 | |
| AMNBackbone=R101, Supervision=I, Framework=Multi-stage2022.04 | 44.7 | |
| SANCEBackbone=R101, Supervision=I, Framework=Multi-stage2022.04 | 44.7 | |
| AMNBackbone=ResNet101, Supervision=Image-level supervision only2024.01 | 44.7 | |
| AMNSup.=I, Backbone=ResNet1012024.06 | 44.7 | |
| AMNBackbone=R101, Supervision=I (Image-level)2023.09 | 44.7 | |
| AMNBackbone=ResNet101, Sup.=I, large-scale datasets=false2023.04 | 44.7 | |
| DUPL2024.01 | 44.6 | |
| DuPLBackbone=ViT-B, Sup.=I, large-scale datasets=true2023.04 | 44.6 | |
| DuPLTrain status=Required, Method category=Single-stage2026.04 | 44.6 | |
| SASBackbone=ViT-B/162026.01 | 44.5 | |
| WeakTr2024.01 | 44.4 | |
| DIALBackbone=ViT-B, Sup.=I + L, large-scale datasets=true2023.04 | 44.4 | |
| USAGEBackbone=ResNet101, Supervision=I, Stage=multi-stage weakly supervised2024.06 | 44.3 | |
| L2G*Seg. Architecture=V2, Supervision=I.+S., Backbone=ResNet-1012022.04 | 44.2 | |
| L2GBackbone=ResNet-101, Segmentation Network=DeepLabV2, Supervision Type=Image-level + Saliency maps (I+S)2022.12 | 44.2 | |
| L2GBackbone=ResNet-101, Supervision=I+S2023.04 | 44.2 | |
| L2GBackbone=R101, Supervision=I+S, Framework=Multi-stage2022.04 | 44.2 | |
| L2GType=multi-staged, Backbone=ResNet101, Supervision=image labels + saliency maps2024.02 | 44.2 | |
| L2GBackbone=ResNet101, Supervision=I+S, Stage=multi-stage weakly supervised2024.06 | 44.2 |