Semantic Segmentation on Pascal Context (test)
63.1mIoUSenFormer
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SenFormerbackbone=Swin-L2021.11 | 63.1 | — | — | — | — | — | — | 64.5 | — | — | — | — | — | — | |
| CAABackbone=EfficientNet-B7, Decoder=simple decoder, Multi-scale=true, output stride=42021.01 | 60.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPT-HybridBackbone=DPT-Hybrid, Multi-scale=true2021.01 | 60.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-LResolution=7682026.05 | 60.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CAABackbone=EfficientNet-B7, Decoder=none, Multi-scale=true2021.01 | 60.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-LResolution=7682026.05 | 59.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-LResolution=5122026.05 | 59.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HRNetV2 + OCR + RMIBackbone=HRNetV2, Components=OCR + RMI, Multi-scale=true2021.01 | 59.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-LResolution=5122026.05 | 59.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ResNeSt-269 + DeepLab V3+Backbone=ResNeSt-269, Decoder=DeepLab V3+, Multi-scale=true2021.01 | 58.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-LResolution=3842026.05 | 58.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CAAbackbone=EN-B72021.11 | 58.4 | — | — | — | — | — | — | 60.5 | — | — | — | — | — | — | |
| DINOv3-BResolution=7682026.05 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-LResolution=3842026.05 | 58.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Segmenterbackbone=ViT-L2021.11 | 58.1 | — | — | — | — | — | — | 59 | — | — | — | — | — | — | |
| VECA-BResolution=7682026.05 | 58.05 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-L/16Backbone=ViT-L/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=false2026.04 | 58 | — | — | — | — | — | — | — | — | — | — | — | 686 | 56 | |
| ALGM*Backbone=ViT-L/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=true2026.04 | 58 | — | — | — | — | — | — | — | — | — | — | — | 400 | 58 | |
| ToMeBackbone=ViT-L/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=false2026.04 | 58 | — | — | — | — | — | — | — | — | — | — | — | 522 | 69 | |
| DINOv3-BResolution=5122026.05 | 57.74 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-BResolution=5122026.05 | 57.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MPM (2,5)Backbone=ViT-L/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=false2026.04 | 57.3 | — | — | — | — | — | — | — | — | — | — | — | 416 | 84 | |
| CTS*Backbone=ViT-L/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=true2026.04 | 57.09 | — | — | — | — | — | — | — | — | — | — | — | — | 79 | |
| DINOv3-BResolution=3842026.05 | 57.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-BResolution=3842026.05 | 56.79 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-LResolution=2562026.05 | 56.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-LResolution=2562026.05 | 56.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-S+Resolution=7682026.05 | 56.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OCNet (w/ Base-OC)Backbone=HRNetV2-482018.09 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HRNetV2 + OCRBackbone=HRNetV2, Components=OCR, Multi-scale=true2021.01 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OCNet (w/ ASP-OC)Backbone=HRNetV2-482018.09 | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-S+Resolution=5122026.05 | 55.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SETR-MLAPre=21K, Backbone=T-Large, Training iterations=80k, Inference scale=MS2020.12 | 55.83 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SETR-MLABackbone=SETR-MLA, Multi-scale=true2021.01 | 55.83 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CTNet + JPUBackbone=CTNet, Components=JPU, Multi-scale=true2021.01 | 55.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DNLBackbone=HRNetV2-W482020.06 | 55.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SETR-PUPPre=21K, Backbone=T-Large, Training iterations=80k, Inference scale=MS2020.12 | 55.27 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-SResolution=7682026.05 | 55.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-BResolution=2562026.05 | 55.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-SResolution=5122026.05 | 55.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CAABackbone=ResNet-101, OS=82021.01 | 55 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-B/16Backbone=ViT-B/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=false2026.04 | 55 | — | — | — | — | — | — | — | — | — | — | — | 219 | 159 | |
| ALGM*Backbone=ViT-B/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=true2026.04 | 55 | — | — | — | — | — | — | — | — | — | — | — | 164 | 166 | |
| VECA-BResolution=2562026.05 | 54.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SETR-L MLAbackbone=ViT-L2021.11 | 54.9 | — | — | — | — | — | — | 55.8 | — | — | — | — | — | — | |
| SETR-MLAPre=21K, Backbone=T-Large, Training iterations=80k, Inference scale=SS2020.12 | 54.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-S+Resolution=3842026.05 | 54.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DNLBackbone=ResNet-1012020.06 | 54.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ToMeBackbone=ViT-B/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=false2026.04 | 54.8 | — | — | — | — | — | — | — | — | — | — | — | 161 | 201 | |
| APCNetBackbone=ResNet-1012018.09 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APCNetPre=1K, Backbone=ResNet-1012020.12 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-S+Resolution=5122026.05 | 54.68 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-S+Resolution=7682026.05 | 54.68 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SenFormerbackbone=R1012021.11 | 54.6 | — | — | — | — | — | — | 56.6 | — | — | — | — | — | — | |
| SPNetPublication=-, Backbone=ResNet-1012020.03 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Strip poolingPre=1K, Backbone=ResNet-1012020.12 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CTS*Backbone=ViT-B/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=true2026.04 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | 197 | |
| MPM (2,5)Backbone=ViT-B/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=false2026.04 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | 153 | 213 | |
| DMNetBackbone=ResNet-1012020.06 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SETR-PUPPre=21K, Backbone=T-Large, Training iterations=80k, Inference scale=SS2020.12 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NLBackbone=HRNetV2-W482020.06 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GFFNetPre=1K, Backbone=ResNet-1012020.12 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ACNetBackbone=Res-1012019.11 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ACNetBackbone=ResNet-1012020.06 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OCNet (w/ Base-OC)Backbone=ResNet-1012018.09 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-SResolution=3842026.05 | 54.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-S+Resolution=3842026.05 | 54.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HRNetV2Backbone=HRNetV2-W482020.06 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFNetBackbone=ResNet-1012020.06 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFNetBackbone=ResNet-1012018.09 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HRNetV2Backbone=HRNetV2-482018.09 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OCNet (w/ ASP-OC)Backbone=ResNet-1012018.09 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFNetBackbone=ResNet-1012021.01 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CPNBackbone=ResNet-1012021.01 | 53.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-SResolution=7682026.05 | 53.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SETR-MLA-DeiTPre=1K, Backbone=T-Base, Training iterations=80k, Inference scale=MS2020.12 | 53.74 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SETR-PUP-DeiTPre=1K, Backbone=T-Base, Training iterations=80k, Inference scale=MS2020.12 | 53.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CAABackbone=ResNet-101, OS=162021.01 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SETR-NaïvePre=21K, Backbone=T-Large, Training iterations=80k, Inference scale=MS2020.12 | 53.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BFPPublication=ICCV'19, Backbone=ResNet-1012020.03 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-SResolution=5122026.05 | 53.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SVCNet2019.09 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SVCNetPublication=CVPR'19, Backbone=ResNet-1012020.03 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SVCNetBackbone=ResNet-1012020.06 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SVCNetBackbone=ResNet-1012018.09 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SVCNetPre=1K, Backbone=ResNet-1012020.12 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepLabV3+backbone=R1012021.11 | 53.2 | — | — | — | — | — | — | 54.67 | — | — | — | — | — | — | |
| ALGM*Backbone=ViT-S/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=true2026.04 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | 52 | 430 | |
| SenFormerbackbone=R502021.11 | 53.18 | — | — | — | — | — | — | 54.3 | — | — | — | — | — | — | |
| EMANetPublication=ICCV'19, Backbone=ResNet-1012020.03 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMANetBackbone=ResNet-1012020.06 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMANetBackbone=ResNet-1012018.09 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMANetPre=1K, Backbone=ResNet-1012020.12 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMANetBackbone=ResNet-1012019.07 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMANetBackbone=ResNet-1012021.01 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-S/16Backbone=ViT-S/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=false2026.04 | 53 | — | — | — | — | — | — | — | — | — | — | — | 64 | 426 | |
| ToMeBackbone=ViT-S/16, Hardware=H100, Precision=Float 32, Input Resolution=480x480px, Segmentation Head=Mask Transformer, Training required=false2026.04 | 53 | — | — | — | — | — | — | — | — | — | — | — | 45 | 505 | |
| SETR-MLA-DeiTPre=1K, Backbone=T-Base, Training iterations=80k, Inference scale=SS2020.12 | 52.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SETR-NaïvePre=21K, Backbone=T-Large, Training iterations=80k, Inference scale=SS2020.12 | 52.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VECA-SResolution=3842026.05 | 52.85 | — | — | — | — | — | — | — | — | — | — | — | — | — |