Semantic Segmentation on COCO Stuff-27 (val)
2,820mIoUSTEGO+CRF
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| STEGO+CRFBackbone=ViT-B/8, Post-processing=CRF2023.12 | 2,820 | — | |
| Spectral Clustering (V-V graph) + CRFBackbone=Stable Diffusion, Graph=V-V, Post-processing=CRF2023.12 | 2,710 | — | |
| STEGOBackbone=ViT-B/82023.12 | 2,680 | — | |
| Spectral Clustering (V-V graph)Backbone=Stable Diffusion, Graph=V-V2023.12 | 2,540 | — | |
| HPBackbone=ViT-S/82023.12 | 2,460 | — | |
| ACSeg2023.12 | 1,640 | — | |
| PiCIE+H2023.12 | 1,440 | — | |
| PiCIE2023.12 | 1,380 | — | |
| Modified DC2023.12 | 980 | — | |
| DSMBackbone=ViT-B/82023.12 | 890 | — | |
| IIC2023.12 | 670 | — | |
| MoCo v22023.12 | 440 | — | |
| JAFARBackbone=DINOv2-ViT-S/14, Method Category=Task-Agnostic, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 60.78 | 80.47 | |
| FeatUpBackbone=DINOv2-ViT-S/14, Method Category=Task-Agnostic, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 60.1 | 79.95 | |
| ReSFuBackbone=DINOv2-ViT-S/14, Method Category=Task-Dependent, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 60.08 | 79.84 | |
| CARAFEBackbone=DINOv2-ViT-S/14, Method Category=Task-Dependent, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 59.73 | 79.65 | |
| DySampleBackbone=DINOv2-ViT-S/14, Method Category=Task-Dependent, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 59.5 | 79.42 | |
| BilinearBackbone=DINOv2-ViT-S/14, Method Category=Training-free, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 59.03 | 79.07 | |
| LIFTBackbone=DINOv2-ViT-S/14, Method Category=Task-Agnostic, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 58.18 | 78.95 | |
| SAPABackbone=DINOv2-ViT-S/14, Method Category=Task-Dependent, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 57.77 | 78.28 | |
| NearestBackbone=DINOv2-ViT-S/14, Method Category=Training-free, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 56.17 | 76.97 | |
| StridedBackbone=DINOv2-ViT-S/14, Method Category=Training-free, Resolution=448x448, Evaluation Protocol=Linear Probing2025.06 | 55.93 | 77.4 | |
| DiffCutLanguage Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 49.1 | — | |
| DINO-LEncoder=DINO-L, Repr.=teacher, Evaluation Protocol=Linear-probe2026.05 | 44.9 | — | |
| DINO-BEncoder=DINO-B, Repr.=teacher, Evaluation Protocol=Linear-probe2026.05 | 44.6 | — | |
| DiffSeg†Language Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 44.2 | — | |
| DiffSegLanguage Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 43.6 | — | |
| STEGO + HPProtocol=Linear, Backbone=ViT-S/82023.09 | 42.7 | 75.6 | |
| MaskCutk=5, Language Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 41.7 | — | |
| DepthGProtocol=Linear, Backbone=ViT-B/82023.09 | 41.6 | 75.5 | |
| STEGOevaluation_protocol=Linear Probe2022.03 | 41 | 76.1 | |
| STEGOProtocol=Linear, Backbone=ViT-B/82023.09 | 41 | 76.1 | |
| STROP-SEncoder=DINO-B, Model=STROP-S, Repr.=latent, Evaluation Protocol=Linear-probe2026.05 | 39.2 | — | |
| DepthGProtocol=Linear, Backbone=ViT-S/82023.09 | 38.9 | 73.7 | |
| STEGOProtocol=Linear, Backbone=ViT-S/82023.09 | 38.3 | 74.4 | |
| DepthG w/ 3D-LHPProtocol=Linear, Backbone=ViT-S/82023.09 | 37.8 | 73.9 | |
| DINO-SEncoder=DINO-S, Repr.=teacher, Evaluation Protocol=Linear-probe2026.05 | 36.3 | — | |
| STROP-MEncoder=DINO-B, Model=STROP-M, Repr.=latent, Evaluation Protocol=Linear-probe2026.05 | 36.3 | — | |
| STROP-MEncoder=DINO-L, Model=STROP-M, Repr.=latent, Evaluation Protocol=Linear-probe2026.05 | 36.2 | — | |
| DINOProtocol=Linear, Backbone=ViT-S/82023.09 | 33.9 | 68.6 | |
| STROP-SEncoder=DINO-S, Model=STROP-S, Repr.=latent, Evaluation Protocol=Linear-probe2026.05 | 32.5 | — | |
| U2SegLanguage Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=true, Training Type=Extra-Training2024.06 | 30.2 | — | |
| STROP-MEncoder=DINO-S, Model=STROP-M, Repr.=latent, Evaluation Protocol=Linear-probe2026.05 | 29.5 | — | |
| DINOevaluation_protocol=Linear Probe2022.03 | 29.4 | 66.8 | |
| DINOProtocol=Linear, Backbone=ViT-B/82023.09 | 29.4 | 66.8 | |
| DepthGProtocol=Unsupervised, Backbone=ViT-B/82023.09 | 29 | 58.6 | |
| STEGOLanguage Dependency (LD)=true, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=true, Training Type=Extra-Training2024.06 | 28.2 | — | |
| STEGOevaluation_protocol=Unsupervised2022.03 | 28.2 | 56.9 | |
| STEGOProtocol=Unsupervised, Backbone=ViT-B/82023.09 | 28.2 | 56.9 | |
| ACSegLanguage Dependency (LD)=true, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=true, Training Type=Extra-Training2024.06 | 28.1 | — | |
| EAGLELanguage Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=true, Training Type=Extra-Training2024.06 | 27.2 | — | |
| DepthG w/ 3D-LHPProtocol=Unsupervised, Backbone=ViT-S/82023.09 | 26.7 | 55.1 | |
| ReCoLanguage Dependency (LD)=true, Auxiliary Image (AX)=true, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 26.3 | — | |
| DepthGProtocol=Unsupervised, Backbone=ViT-S/82023.09 | 25.6 | 56.3 | |
| STEGO + HPProtocol=Unsupervised, Backbone=ViT-S/82023.09 | 24.6 | 57.2 | |
| STEGOProtocol=Unsupervised, Backbone=ViT-S/82023.09 | 24.5 | 48.3 | |
| DINOSAURProtocol=Unsupervised, Backbone=ViT-B/8, post-processing optimization=none2023.09 | 24 | 44.9 | |
| FlexTokEncoder=FlexTok, Model=D12-D12-IN1k, Repr.=latent, Evaluation Protocol=Linear-probe2026.05 | 21.6 | — | |
| STROP-SEncoder=DINO-S, Model=STROP-S, Repr.=program, Evaluation Protocol=Linear-probe2026.05 | 20 | — | |
| MaskCLIPLanguage Dependency (LD)=true, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 19.6 | — | |
| STROP-SEncoder=DINO-B, Model=STROP-S, Repr.=program, Evaluation Protocol=Linear-probe2026.05 | 19.5 | — | |
| STROP-MEncoder=DINO-L, Model=STROP-M, Repr.=program, Evaluation Protocol=Linear-probe2026.05 | 18.8 | — | |
| STROP-MEncoder=DINO-B, Model=STROP-M, Repr.=program, Evaluation Protocol=Linear-probe2026.05 | 18 | — | |
| STROP-MEncoder=DINO-S, Model=STROP-M, Repr.=program, Evaluation Protocol=Linear-probe2026.05 | 16.6 | — | |
| FlexTokEncoder=FlexTok, Model=D12-D12-IN1k, Repr.=program, Evaluation Protocol=Linear-probe2026.05 | 15.6 | — | |
| PiCIE + Hevaluation_protocol=Linear Probe2022.03 | 14.8 | 54.8 | |
| PiCIE+HProtocol=Linear, Backbone=R18+FPN2023.09 | 14.8 | 54.8 | |
| PiCIE+HLanguage Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=true, Training Type=Extra-Training2024.06 | 14.4 | — | |
| PiCIE + Hevaluation_protocol=Unsupervised2022.03 | 14.4 | 50 | |
| PiCIE+HProtocol=Unsupervised, Backbone=R18+FPN2023.09 | 14.4 | 50 | |
| PiCIEevaluation_protocol=Linear Probe2022.03 | 13.9 | 54.2 | |
| PiCIEProtocol=Linear, Backbone=R18+FPN2023.09 | 13.9 | 54.2 | |
| PiCIELanguage Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=true, Training Type=Extra-Training2024.06 | 13.8 | — | |
| PiCIEevaluation_protocol=Unsupervised2022.03 | 13.8 | 48.1 | |
| PiCIEProtocol=Unsupervised, Backbone=R18+FPN2023.09 | 13.8 | 48.1 | |
| MDCevaluation_protocol=Linear Probe2022.03 | 13.3 | 48.6 | |
| MoCoV2evaluation_protocol=Linear Probe2022.03 | 13.2 | 44.4 | |
| DINOProtocol=Unsupervised, Backbone=ViT-S/82023.09 | 11.3 | 28.7 | |
| One-D-Piece-S-256Encoder=DINOv3-S, Model=One-D-Piece-S-256, Repr.=latent, Evaluation Protocol=Linear-probe2026.05 | 10.6 | — | |
| MoCoV2evaluation_protocol=Unsupervised2022.03 | 10.4 | 25.2 | |
| ResNet50evaluation_protocol=Linear Probe2022.03 | 10.2 | 41.3 | |
| MDCLanguage Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=true, Training Type=Extra-Training2024.06 | 9.8 | — | |
| MDCevaluation_protocol=Unsupervised2022.03 | 9.8 | 32.2 | |
| DINOevaluation_protocol=Unsupervised2022.03 | 9.6 | 30.5 | |
| DINOProtocol=Unsupervised, Backbone=ViT-B/82023.09 | 9.6 | 30.5 | |
| ResNet50evaluation_protocol=Unsupervised2022.03 | 8.9 | 24.6 | |
| IICevaluation_protocol=Linear Probe2022.03 | 8.4 | 44.5 | |
| IICProtocol=Linear, Backbone=R18+FPN2023.09 | 8.4 | 44.5 | |
| One-D-Piece-S-256Encoder=DINOv3-S, Model=One-D-Piece-S-256, Repr.=program, Evaluation Protocol=Linear-probe2026.05 | 7.2 | — | |
| IICLanguage Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=true, Training Type=Extra-Training2024.06 | 6.7 | — | |
| IICevaluation_protocol=Unsupervised2022.03 | 6.7 | 21.8 | |
| IICProtocol=Unsupervised, Backbone=R18+FPN2023.09 | 6.7 | 21.8 | |
| ACevaluation_protocol=Unsupervised2022.03 | — | 30.8 | |
| ACSegProtocol=Unsupervised, Backbone=ViT-S/82023.09 | — | 16.1 | |
| Deep Clusterevaluation_protocol=Unsupervised2022.03 | — | 19.9 | |
| DINO2022.11 | — | 30.5 | |
| Doersch et al.evaluation_protocol=Unsupervised2022.03 | — | 23.1 | |
| IIC2022.11 | — | 21 | |
| InMARSevaluation_protocol=Unsupervised2022.03 | — | 31 | |
| Isola et al.evaluation_protocol=Unsupervised2022.03 | — | 24.3 |