Semantic Segmentation on Pascal Context
83.43mIoURADIOv2.5-H
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| RADIOv2.5-HParams=653M2024.12 | 83.43 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADIOv2.5-LParams=320M2024.12 | 82.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADIOv2.1-HParams=653M2024.12 | 82.78 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADIOv2.5-gParams=1.1B2024.12 | 82.65 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UNITParams=632M2024.12 | 82.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UNITParams=1B2024.12 | 82.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UNIC-LParams=307M2024.12 | 81.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADIOv2.5-BParams=98M2024.12 | 81.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UNIC-BParams=86M2024.12 | 75.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TheiaParams=86M2024.12 | 69.84 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PlainSeg-Hierbackbone=BEiTv2-L, PRM=326M, test time=317ms2023.10 | 69.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SegViTbackbone=BEiTv2-L, PRM=344M, test time=245ms2023.10 | 66.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Single-Task2022.03 | 64.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DYMUc=0, initialization=Anchor net weights, # Params (%)=-35.22022.03 | 63.6 | — | — | — | — | — | — | — | — | — | — | 0.18 | — | — | |
| GiT-HModel Size=Huge, Training Protocol=universal2024.03 | 63.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DYMUc=1, initialization=Anchor net weights, # Params (%)=-40.82022.03 | 63.12 | — | — | — | — | — | — | — | — | — | — | -0.34 | — | — | |
| BMTAS# Params (%)=-48.92022.03 | 62.79 | — | — | — | — | — | — | — | — | — | — | -0.93 | — | — | |
| DYMUc=0, initialization=ImageNet weights, # Params (%)=-35.22022.03 | 62.34 | — | — | — | — | — | — | — | — | — | — | -0.81 | — | — | |
| DYMUc=1, initialization=ImageNet weights, # Params (%)=-40.82022.03 | 61.91 | — | — | — | — | — | — | — | — | — | — | -1.05 | — | — | |
| LTB# Params (%)=-35.02022.03 | 61.84 | — | — | — | — | — | — | — | — | — | — | -1.12 | — | — | |
| GiT-LModel Size=Large, Training Protocol=universal2024.03 | 60.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GiT-BModel Size=Base, Training Protocol=universal2024.03 | 56.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CTNetBackbone=ResNet-1012021.04 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OCR (Seg. transformer)Baseline=HRNetV2-W48, Stride=4x, Context schemes=R2019.09 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OVSegEncoder=ViT-B/16, Model=CLIP, Pretraining=COCO-Stuff-171, Annotation=UM, Localization Annotation=true, Localization Fine-tuning=true2023.12 | 55.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OCR (Seg. transformer)Baseline=ResNet-101, Stride=8x, Context schemes=R2019.09 | 54.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APCNetBaseline=ResNet-101, Stride=8x, Context schemes=M,R2019.09 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OSCMBackbone=ResNet-1012021.04 | 54.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepLabV3+Training Dataset=Pascal Context, Evaluation Protocol=Supervised2022.02 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ours_SegformerBackbone=Segformer, Training Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ACNetBaseline=ResNet-101 + MG, Stride=4x, Context schemes=M,R2019.09 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFNetBackbone=ResNet-1012021.04 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFNetBaseline=ResNet-101, Stride=8x, Context schemes=R2019.09 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HRNetBaseline=HRNetV2-W48, Stride=4x2019.09 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DGCNetBackbone=ResNet-101, Scale=Multi scale2019.09 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BFPBaseline=ResNet-101, Stride=8x, Context schemes=R2019.09 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SVCNetBaseline=ResNet-101, Stride=4x, Context schemes=R2019.09 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMANetBackbone=ResNet-1012021.04 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMANetBaseline=ResNet-101 + MG, Stride=8x, Context schemes=R2019.09 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineBackbone=Segmenter(ViT-S), Speedup=1.00×, GFLOPS=32.092025.09 | 53.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DGCNetBackbone=ResNet-101, Scale=Single scale2019.09 | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ALGMBackbone=Segmenter(ViT-S), Speedup=1.35×, GFLOPS=22.282025.09 | 52.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CuMeBackbone=Segmenter(ViT-S), Speedup=1.27×, GFLOPS=23.432025.09 | 52.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ANNetBaseline=ResNet-101, Stride=8x, Context schemes=M,R2019.09 | 52.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DANetBackbone=ResNet-1012019.09 | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SGRBaseline=ResNet-101 + ASPP, Stride=8x, Context schemes=R2019.09 | 52.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DUpsamplingBaseline=Xception-71, Stride=4x, Context schemes=M2019.09 | 52.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SGRBackbone=ResNet-1012019.09 | 52.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZigZagNetBaseline=ResNet-101, Stride=4x, Context schemes=M2019.09 | 52.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EncNetFPS=12, Number of parameters=54.5M2018.11 | 51.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EncNetBaseline=ResNet-101, Stride=8x2019.09 | 51.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EncNetBackbone=ResNet-101, Scale=Multi scale2019.09 | 51.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ding et al.Backbone=ResNet-1012019.09 | 51.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DANetBackbone=ResNet-1012021.04 | 50.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PACLEncoder=ViT-B/16, Model=CLIP, Pretraining=WIT-400M +CC12M, YFCC, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=true2023.12 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DANetBackbone=ResNet-502019.09 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DGCNetBackbone=ResNet-50, Scale=Single scale2019.09 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EncNetBackbone=ResNet-50, Scale=Single scale2019.09 | 49 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ours_HRNetBackbone=HRNet, Training Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 48.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Size=Base, Resolution=Mid, Zero-shot=true, Open-vocabulary=true2025.11 | 48.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Scale=Base, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 48.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Scale=Base, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 48.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ShelfNet101Backbone=Res101, FPS=42, Number of parameters=57.7M2018.11 | 48.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Size=Base, Resolution=Low, Zero-shot=true, Open-vocabulary=true2025.11 | 48.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Scale=Base, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 48.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSegEncoder=ENet-B7+FPN, Model=ALIGN, Pretraining=COCO, Loc. Narr, Annotation=IT, UM, Localization Annotation=true, Localization Fine-tuning=true2023.12 | 48.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Size=Huge, Resolution=High, Zero-shot=true, Open-vocabulary=true2025.11 | 47.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Scale=Huge, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 47.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Size=Base, Resolution=High, Zero-shot=true, Open-vocabulary=true2025.11 | 47.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PSPNetBackbone=ResNet-1012021.04 | 47.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PSPNetBaseline=ResNet-101, Stride=8x, Context schemes=M2019.09 | 47.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PSPNetBackbone=ResNet-1012019.09 | 47.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Size=Huge, Resolution=Mid, Zero-shot=true, Open-vocabulary=true2025.11 | 47.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Scale=Huge, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 47.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineNetBackbone=Res152, FPS=16, Number of parameters=134M2018.11 | 47.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineNetBackbone=ResNet-1012019.09 | 47.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineNetBackbone=Res101, FPS=19, Number of parameters=118M2018.11 | 47.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TextRegionModel Size=Huge, Resolution=High, Zero-shot=true, Open-vocabulary=true2025.11 | 46.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TextRegionModel Scale=Huge, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 46.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskCLIP(3)Encoder=ViT-B/16, Model=CLIP, Pretraining=COCO, Annotation=SM, Localization Annotation=true, Localization Fine-tuning=false2023.12 | 45.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Size=Huge, Resolution=Low, Zero-shot=true, Open-vocabulary=true2025.11 | 45.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSeg+Model Scale=Huge, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 45.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepLab-v2Backbone=Res101-COCO, FPS=12, Number of parameters=43.9M2018.11 | 45.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepLab-v2 (COCO)Backbone=ResNet-1012019.09 | 45.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSegModel Size=Base, Resolution=Mid, Zero-shot=true, Open-vocabulary=true2025.11 | 45.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSegModel Scale=Base, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 45.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSegModel Scale=Base, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 45.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ShelfNet50Backbone=Res50, FPS=59, Number of parameters=38.7M2018.11 | 45.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LocAtViTBackbone Variant=Base2026.03 | 45.35 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MSegTraining Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 45.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSegModel Size=Base, Resolution=High, Zero-shot=true, Open-vocabulary=true2025.11 | 45.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSegModel Size=Huge, Resolution=High, Zero-shot=true, Open-vocabulary=true2025.11 | 45.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSegModel Scale=Huge, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 45.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DaViTBackbone Variant=Base2026.03 | 44.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConViTBackbone Variant=Base2026.03 | 44.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSegModel Size=Huge, Resolution=Mid, Zero-shot=true, Open-vocabulary=true2025.11 | 44.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADSegModel Scale=Huge, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 44.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TextRegionModel Size=Huge, Resolution=Mid, Zero-shot=true, Open-vocabulary=true2025.11 | 44.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TextRegionModel Scale=Huge, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 44.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GCViTBackbone Variant=Base2026.03 | 44.71 | — | — | — | — | — | — | — | — | — | — | — | — | — |