Semantic Segmentation on ADE20K
68.64mIoUIntern-ViT-6B (448)
Evaluation Results
| Method | Links | ||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Intern-ViT-6B (448)Params (M)=5537, Resolution=448, Throughput=14, Evaluation=linear probe2023.12 | 68.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| State-of-the-Art (Wang et al., 2022)Mode=Absolute state-of-the-art2023.04 | 62.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-3 (Multiway-T)Additions=None2026.01 | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch.=ViT-g/14, Pipeline=Mask2Former + ViT-Adapter2023.04 | 60.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PlainSeg-Hierbackbone=BEiTv2-L, PRM=322M, test time=308ms2023.10 | 59.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LQDSParams=453M, GFLOPs=9342026.01 | 59.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EoMT-DinoV3Params=319M, GFLOPs=7212026.01 | 59.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Depth AnythingEncoder=ViT-L, Segmentation Framework=Mask2Former2024.01 | 59.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternViT-6Bdecoder=UperNet, trainable/total parameters=6.3B/6.3B, crop size=504x504, evaluation protocol=full-parameter tuning2023.12 | 58.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerParams=351M, GFLOPs=9102026.01 | 58.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EoMT-DinoV2Params=319M, GFLOPs=7212026.01 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-AdapterEncoder=BEIT-L2024.01 | 58.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X-Decoder (DaViT-d5)Additions=X-Decoder2026.01 | 58.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SegViTbackbone=BEiTv2-L, PRM=345M, test time=287ms2023.10 | 58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-L+Pre-training protocol=Self-Supervised, Intermediate Fine-Tuning=true, Pre-training dataset=In-House-70M, Resolution=640x640, Task layer=UperNet2021.06 | 57.9 | — | — | — | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former2022.12 | 57.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Formervenue=CVPR'22, model_type=specialist model2023.04 | 57.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerEncoder=Swin-L2024.01 | 57.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerEncoder=ConvNeXt-XL2024.01 | 57.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-L+Pre-training protocol=Self-Supervised, Intermediate Fine-Tuning=true, Pre-training dataset=ImageNet-22K, Resolution=640x640, Task layer=UperNet2021.06 | 56.7 | — | — | — | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerEncoder=Swin-L2024.01 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Classic Specialist (Non-VLM)Model Category=Classic Specialist, Task-specific fine-tuning=true2026.01 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UperNetEncoder=BEIT-L2024.01 | 56.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| dBOTstudent backbone=ViT-L, teacher=CLIP-L [31]2022.09 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former (Swin-L)Additions=Pixel Decoder2026.01 | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3Variant=7B, Params=6,716M2026.01 | 55.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniFlowSize=ViT-L, Fine-tuning=true2025.10 | 55.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PlainSeg-Hierbackbone=BEiTv2-B, PRM=106M, test time=99ms2023.10 | 55.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-22Bdecoder=UperNet, trainable/total parameters=22.5B/22.5B, crop size=504x504, evaluation protocol=full-parameter tuning2023.12 | 55.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAPA-GArchitecture=Mask2Former SwinB [9], FLOPs=+0.45, Params=+0.022022.09 | 55.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| C-RADIOv4Variant=H, Params=631M2026.01 | 55.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| C-RADIOv4Variant=SO400M, Params=412M2026.01 | 55.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAPA-IArchitecture=Mask2Former SwinB [9], FLOPs=+0.33, Params=+0.002022.09 | 55.05 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAPA-BArchitecture=Mask2Former SwinB [9], FLOPs=+0.45, Params=+0.022022.09 | 54.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DySample-S+Backbone=Swin-L, Upsampler=DySample-S+2023.08 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternViT-6Bdecoder=UperNet, trainable/total parameters=0.4B/6.3B, crop size=504x504, evaluation protocol=head tuning, state=frozen2023.12 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3Variant=H+, Params=841M2026.01 | 54.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IndexNetArchitecture=Mask2Former SwinB [9], FLOPs=+13.44, Params=+2.102022.09 | 54.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CARAFEBackbone=Swin-L, Upsampler=CARAFE2023.08 | 54.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADIOv2.5-gParams=1.1B2024.12 | 54.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-L (random initialized)student backbone=ViT-L, teacher initialization=random2022.09 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UFOModel Category=Vision-Centric VLM, Model Parameters=8B, Extra task-specific tokens (†)=true2026.01 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UFO (InternVL2.5-8B)Additions=Mask Tokens2026.01 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| A2UArchitecture=Mask2Former SwinB [9], FLOPs=+0.18, Params=+0.012022.09 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimMIMBackbone=SwinV2-H2021.11 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Youtu-VLModel Category=General-Purpose VLM, Model Parameters=4B, Instruct Version=true2026.01 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Youtu-VL (4B)Additions=None2026.01 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NearestBackbone=Swin-L, Upsampler=Nearest2023.08 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SegViTbackbone=BEiTv2-B, PRM=109M, test time=69ms2023.10 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NEPAPre-train data=IN1K, Backbone=ViT-L2025.12 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADIOv2.5-HParams=653M2024.12 | 53.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CARAFEArchitecture=Mask2Former SwinB [9], FLOPs=+0.63, Params=+0.072022.09 | 53.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DySample-S+Backbone=Swin-B, Upsampler=DySample-S+2023.08 | 53.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BilinearArchitecture=Mask2Former SwinB [9], FLOPs=223, Params=1072022.09 | 53.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIDType=Generalist, Backbone=Swin-L, Data=ImageNet-1K, w/ Labels=false2024.04 | 53.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAPA-GArchitecture=MaskFormer SwinB [8], FLOPs=+0.59, Params=+0.052022.09 | 53.78 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-B+Pre-training protocol=Self-Supervised, Intermediate Fine-Tuning=true, Pre-training dataset=ImageNet-22K, Resolution=640x640, Task layer=UperNet2021.06 | 53.6 | — | — | — | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAEPre-training Data=IN1K, Backbone=ViT-L, Epochs=16002023.09 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAEPre-train data=IN1K, Backbone=ViT-L2025.12 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pixio-HEvaluation Head=DPT Head2025.12 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAESize=ViT-L, Fine-tuning=true2025.10 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CARAFEArchitecture=MaskFormer SwinB [8], FLOPs=+0.84, Params=+0.222022.09 | 53.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CARAFEBackbone=Swin-B, Upsampler=CARAFE2023.08 | 53.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimMIMBackbone=Swin-L2021.11 | 53.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 4M (ViT-L)Additions=Task-specific Heads2026.01 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEITPre-training Data=IN1K+DALLE, Backbone=ViT-L, Epochs=8002023.09 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEiTPre-train data=IN1K + DALLE, Backbone=ViT-L2025.12 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEiTSize=ViT-L, Fine-tuning=true2025.10 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAPA-IArchitecture=MaskFormer SwinB [8], FLOPs=+0.43, Params=+0.002022.09 | 53.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MIRLPre-training Data=IN1K, Backbone=ViT-B-48, Epochs=8002023.09 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAPA-BArchitecture=MaskFormer SwinB [8], FLOPs=+0.59, Params=+0.052022.09 | 53.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch.=ViT-L/14, Evaluation=Multiscale (+ms)2023.04 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch.=ViT-g/14, Evaluation=Multiscale (+ms)2023.04 | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADIOv2.5-LParams=320M2024.12 | 52.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IndexNetArchitecture=MaskFormer SwinB [8], FLOPs=+17.64, Params=+6.302022.09 | 52.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| dBOTstudent backbone=ViT-B, teacher=CLIP-B [31]2022.09 | 52.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimMIMBackbone=Swin-B2021.11 | 52.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| C-RADIOv3Variant=H, Params=631M2026.01 | 52.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| A2UArchitecture=MaskFormer SwinB [8], FLOPs=+0.23, Params=+0.032022.09 | 52.73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NearestArchitecture=MaskFormer SwinB [8], FLOPs=195, Params=1022022.09 | 52.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MILANEpochs=400, Pre-training Dataset=ImageNet-1K, Segmentation Framework=UperNet2022.11 | 52.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NearestBackbone=Swin-B, Upsampler=Nearest2023.08 | 52.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-22Bdecoder=UperNet, trainable/total parameters=0.8B/22.5B, crop size=504x504, evaluation protocol=head tuning2023.12 | 52.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIDType=Generalist, Backbone=Swin-B, Data=ImageNet-1K, w/ Labels=false2024.04 | 52.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RAVLT-LType=Linear, Params (M)=98, FLOPs (G)=424, Framework=Semantic FPN 80K2024.11 | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReSFUBackbone=Segmenter-ViT-L, Params=304.98M2024.07 | 52.56 | — | — | — | — | — | — | — | — | — | — | 63.63 | — | — | 35.27 | — | — | — | |
| MVPEpochs=300, Pre-training Dataset=ImageNet-1K, Segmentation Framework=UperNet2022.11 | 52.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerType=Specialist, Backbone=Swin-B2024.04 | 52.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionLLM v2Model Category=Vision-Centric VLM, Model Parameters=7B, Task-specific decoders (*)=true2026.01 | 52.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionLLM v2 (Swin-T)Additions=Deform-DETR2026.01 | 52.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3-H+Evaluation Head=DPT Head2025.12 | 52.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-LPre-training protocol=Supervised, Pre-training dataset=ImageNet-22K, Resolution=640x640, Task layer=UperNet2021.06 | 52.1 | — | — | — | 53.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskAlignEpochs=200, Pre-training Dataset=ImageNet-1K, Segmentation Framework=UperNet2022.11 | 52.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DySampleBackbone=Segmenter-ViT-L, Params=305.02M2024.07 | 52.04 | — | — | — | — | — | — | — | — | — | — | 63.27 | — | — | 34.17 | — | — | — | |
| RAVLT-BType=Linear, Params (M)=51, FLOPs (G)=292, Framework=Semantic FPN 80K2024.11 | 51.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CARAFEBackbone=Segmenter-ViT-L, Params=305.14M2024.07 | 51.85 | — | — | — | — | — | — | — | — | — | — | 62.96 | — | — | 34.49 | — | — | — | |
| SegmenterEncoder=ViT-L2024.01 | 51.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SigLIP2ViT=L/16, Data=10B2026.01 | 51.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADIOv2.5Variant=H, Params=631M2026.01 | 51.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv2-gEvaluation Head=DPT Head2025.12 | 51.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |