Semantic Segmentation on VOC
89.18mIoUViT-Up
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ViT-UpBackbone=DINOv3-B, Evaluation Protocol=Seg. Probing2026.06 | 89.18 | — | — | — | |
| NAFBackbone=DINOv3-B, Evaluation Protocol=Seg. Probing2026.06 | 88.07 | — | — | — | |
| ViT-UpBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 87.47 | — | — | 97.14 | |
| BilinearBackbone=DINOv3-B, Evaluation Protocol=Seg. Probing2026.06 | 87.2 | — | — | — | |
| NAFBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 85.84 | — | — | 96.72 | |
| UpLiFTBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 85.69 | — | — | 96.72 | |
| UPLiFTBackbone=DINOv2-S/14, Params (M)=0.82026.01 | 85.21 | — | — | 96.51 | |
| DiffuMask (Fine-tuned)Training Protocol=Fine-tuned on real dataset after pre-training on synthetic dataset, Real images=VOC (5k), Synthetic images=DiffuMask (60k)2026.03 | 84.9 | — | — | — | |
| BilinearBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 84.88 | — | — | 96.45 | |
| UPLiFTBackbone=DINOv3-S+/16, Params (M)=0.82026.01 | 84.72 | — | — | 96.55 | |
| AnyUpBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 84.54 | — | — | 96.34 | |
| JAFARBackbone=DINOv2-S/14, Params (M)=0.72026.01 | 84.38 | — | — | 96.22 | |
| AnyUpBackbone=DINOv2-S/14, Params (M)=0.92026.01 | 84 | — | — | 96.19 | |
| Ours (Fine-tuned)Training Protocol=Fine-tuned on real dataset after pre-training on synthetic dataset, Real images=VOC (1.5k), Synthetic images=Ours (2,9k)2026.03 | 84 | — | — | — | |
| JAFARBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 83.88 | — | — | 96.16 | |
| Mask2Former (Swin-B)Training Protocol=Trained on real dataset, Real images=VOC (5k)2026.03 | 83.4 | — | — | — | |
| JAFARBackbone=DINOv3-S+/16, Params (M)=0.72026.01 | 83.05 | — | — | 95.99 | |
| SG (Fine-tuned)Training Protocol=Fine-tuned on real dataset after pre-training on synthetic dataset, Real images=VOC (1.5k), Synthetic images=SG (1,5k)2026.03 | 82.8 | — | — | — | |
| DD (Fine-tuned)Training Protocol=Fine-tuned on real dataset after pre-training on synthetic dataset, Real images=VOC (1.5k), Synthetic images=DD (40k)2026.03 | 82.4 | — | — | — | |
| AutoDeepLabTraining Dataset=VOC, Evaluation Protocol=Supervised2022.02 | 82 | — | — | — | |
| Mask2Former (Swin-B)Training Protocol=Trained on real dataset, Real images=VOC (1.5k)2026.03 | 81.8 | — | — | — | |
| Ours_SegformerBackbone=Segformer, Training Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 81.1 | — | — | — | |
| OursTraining Protocol=Trained on synthetic dataset, Synthetic images=Ours (2,9k)2026.03 | 76.3 | — | — | — | |
| Ours_HRNetBackbone=HRNet, Training Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 74.9 | — | — | — | |
| HRNet (COCO)Backbone=HRNet, Training Dataset=COCO, Evaluation Protocol=Zero-shot2022.02 | 73.7 | — | — | — | |
| SGTraining Protocol=Trained on synthetic dataset, Synthetic images=SG (1,5k)2026.03 | 73 | — | — | — | |
| Attn2MaskTraining Protocol=Trained on synthetic dataset, Synthetic images=Attn2Mask2026.03 | 71 | — | — | — | |
| MSegTraining Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 70.8 | — | — | — | |
| DiffuMaskTraining Protocol=Trained on synthetic dataset, Synthetic images=DiffuMask (60k)2026.03 | 70.6 | — | — | — | |
| CLS-SEGMethod Category=CLIP-based, Backbone=ViT-B/16, Post-processing=denseCRF2023.12 | 68.7 | — | — | — | |
| DDTraining Protocol=Trained on synthetic dataset, Synthetic images=DD (40k)2026.03 | 67.6 | — | — | — | |
| CLS-SEGMethod Category=CLIP-based, Backbone=ViT-B/162023.12 | 64.8 | — | — | — | |
| NamedMaskMethod Category=CLIP-based2023.12 | 59.2 | — | — | — | |
| SegCLIPMethod Category=CLIP-based2023.12 | 52.6 | — | — | — | |
| GroupViTMethod Category=CLIP-based2023.12 | 52.3 | — | — | — | |
| CLIPpyArch=ViT, Dataset=HQITP-134M, SSP=true2022.10 | 52.2 | — | — | — | |
| CLIPpyArch=ViT, Dataset=CC-12M, SSP=true2022.10 | 50.8 | — | — | — | |
| MaskDistillMethod Category=Vanilla USS2023.12 | 45.8 | — | — | — | |
| OVSArch=ViT, Dataset=CC-12M, SSP=true2022.10 | 44.6 | — | — | — | |
| MaskCLIPMethod Category=CLIP-based, Implementation=Re-implemented2023.12 | 42.1 | — | — | — | |
| CLIPSurgeryMethod Category=CLIP-based, Implementation=Re-implemented2023.12 | 41.5 | — | — | — | |
| GroupViTArch=ViT, Dataset=CC-12M, SSP=false2022.10 | 41.1 | — | — | — | |
| GroupViTArch=ViT, Dataset=CC-12M, SSP=true2022.10 | 40.1 | — | — | — | |
| TransFGUMethod Category=Vanilla USS2023.12 | 37.2 | — | — | — | |
| ResNet50Pre-training=ImageNet-1K2024.11 | 37.2 | 1.079 | 9.21 | — | |
| MaskContrastMethod Category=Vanilla USS2023.12 | 35 | — | — | — | |
| HRNet (ADE)Backbone=HRNet, Training Dataset=ADE, Evaluation Protocol=Zero-shot2022.02 | 34.6 | — | — | — | |
| ReCoMethod Category=CLIP-based2023.12 | 34.2 | — | — | — | |
| ResNet34Pre-training=ImageNet-1K2024.11 | 33.2 | 1.321 | 8.06 | — | |
| ALIGNArch=CNN, Dataset=HQITP-134M, SSP=false2022.10 | 29.7 | — | — | — | |
| MaskCLIPArch=ViT, Dataset=CC-12M, SSP=false2022.10 | 22.1 | — | — | — | |
| HRNet (Mappilary)Backbone=HRNet, Training Dataset=Mappilary, Evaluation Protocol=Zero-shot2022.02 | 22 | — | — | — | |
| U-Net4Pre-training=None, Downsampling layers=42024.11 | 18.2 | 1.985 | 5.41 | — | |
| CLIPArch=ViT, Dataset=HQITP-134M, SSP=false2022.10 | 18.1 | — | — | — | |
| CLIPArch=ViT, Dataset=CC-12M, SSP=false2022.10 | 17.5 | — | — | — | |
| MobileNetPre-training=ImageNet-1K2024.11 | 16.6 | 2.007 | 4.8 | — | |
| CLIPArch=ViT, Dataset=CLIP-400M, SSP=false2022.10 | 16.4 | — | — | — | |
| OneNete, 4Pre-training=None, Downsampling layers=4, Architecture configuration=encoder swap2024.11 | 16 | 2.144 | 4.85 | — | |
| OneNeted, 4Pre-training=None, Downsampling layers=4, Architecture configuration=encoder-decoder swap2024.11 | 14.9 | 2.553 | 3.63 | — | |
| HRNet (IDD)Backbone=HRNet, Training Dataset=IDD, Evaluation Protocol=Zero-shot2022.02 | 14.5 | — | — | — | |
| HRNet (BDD)Backbone=HRNet, Training Dataset=BDD, Evaluation Protocol=Zero-shot2022.02 | 13.5 | — | — | — | |
| HRNet (Cityscapes)Backbone=HRNet, Training Dataset=Cityscapes, Evaluation Protocol=Zero-shot2022.02 | 12.1 | — | — | — | |
| HRNet (SUN)Backbone=HRNet, Training Dataset=SUN, Evaluation Protocol=Zero-shot2022.02 | 10.2 | — | — | — | |
| IICMethod Category=Vanilla USS2023.12 | 9.8 | — | — | — |