Semantic Segmentation on ADE20K (val)
62.9mIoUM3I Pre-training
Evaluation Results
| Method | Links | |||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| M3I Pre-trainingModel=InternImage-H (1B), Pipeline=Single Stage: M3I Pre-training, Public Data=427M image-text, 15M image-category2022.11 | 62.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-32022.08 | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-3Model=BEIT-3 (2B), Pipeline=Stage 1: CLIP, Stage 2: Dense Distillation, Stage 3: Masked Data Modeling, Public Data=21M image-text, 15M image-category, Private Data=400M image-text2022.11 | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEiT3(w/ ViT-Adapter)Backbone=BEiT32022.05 | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-3Crop Size=896^22022.08 | 62 | — | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEiT3Params=1.0 G, Pre-training Images=35 M, Pre-training Annotation=labeled & image-text, Segmenter=Mask2Former2022.12 | 62 | — | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-3 (w/ ViT-Adapter)Framework=Mask2Former, Backbone Pre-train=MM, BEIT-3, Extra Pre-train=COCO-Stuff, sup, Crop Size=896, Iters=80k, #Param=1.3B2022.05 | 62 | — | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LBackbone=ViT-L2022.05 | 61.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FD-SwinV2-GBackbone=SwinV2-G, Protocol=Fine-tuning2022.05 | 61.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FD-SwinV22022.08 | 61.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GModel=SwinV2-G (3B), Pipeline=Stage 1: Masked Image Modeling pixel, Stage 2: Image Classification, Stage 3: Dense Distillation, Public Data=15M image-category, Private Data=55M image-category2022.11 | 61.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FD-SwinV2-GBackbone=SwinV2-G2022.05 | 61.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LFramework=Mask2Former, Backbone Pre-train=MM, BEiTv2, Extra Pre-train=COCO-Stuff, sup, Crop Size=896, Iters=80k, #Param=571M2022.05 | 61.2 | — | 61.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskDINO-Swin-LBackbone=Swin-L, Protocol=Fine-tuning2022.05 | 60.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask DINOData Constraints=Only public training data2022.11 | 60.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LBackbone=ViT-L, Protocol=Fine-tuning2022.05 | 60.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RevCol-HParams=2.1 G, Pre-training Images=168 M, Pre-training Annotation=semi-labeled, Segmenter=Mask2Former2022.12 | 60.4 | — | 61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RevCol-HParams=2.1 G, Pre-training Data=private 168M, Teacher=semi-labeled, Segmenter=Mask2Former2023.09 | 60.4 | — | 61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVA-02-LParams=0.3 G, Pre-training Data=merged 33M, Teacher=EVA01-CLIP, Segmenter=UperNet2023.09 | 60.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GFramework=UperNet, train I(W) size=640(40), test I(W) size=896(56), multi-scale testing=true2021.11 | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GBackbone=SwinV2-G, Protocol=Fine-tuning2022.05 | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GModel=SwinV2-G (3B), Pipeline=Stage 1: Masked Image Modeling pixel, Stage 2: Image Classification, Public Data=15M image-category, Private Data=55M image-category2022.11 | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask DINO2022.08 | 59.5 | — | 60.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-LFramework=Mask DINO, Backbone Pre-train=IN-22K, sup, Extra Pre-train=Objects365, sup, Iters=160k, #Param=223M2022.05 | 59.5 | — | 60.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RevColV2-LParams=0.3 G, Pre-training Data=Laion400M+IN-1K, Teacher=OpenCLIP, Segmenter=Mask2Former2023.09 | 59.5 | — | 60.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-AdapterCrop Size=896^22022.08 | 59.4 | — | 60.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LFramework=Mask2Former, Backbone Pre-train=IN-22K, BEIT, Extra Pre-train=COCO-Stuff, sup, Crop Size=896, Iters=80k, #Param=571M2022.05 | 59.4 | — | 60.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GFramework=UperNet, train I(W) size=640(40), test I(W) size=896(56), multi-scale testing=false2021.11 | 59.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GCrop Size=896^22022.08 | 59.3 | — | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GParams=3.0 G, Pre-training Images=70 M, Pre-training Annotation=labeled, Segmenter=UperNet2022.12 | 59.3 | — | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GFramework=UperNet, Backbone Pre-train=IN-22K, sup, Extra Pre-train=Ext-70M, sup, Crop Size=896, Iters=160k, #Param=3.0B2022.05 | 59.3 | — | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GFramework=UperNet, train I(W) size=640(40), test I(W) size=640(40), multi-scale testing=false2021.11 | 59.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-L + Mask2FormerPre-training=BEIT + IN22k, Multi-scale testing=true2023.06 | 59 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (L)Type=Open-vocabulary, Backbone=Large2023.03 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Depth Anything V2Encoder=Large, Framework=Mask2Former2024.06 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEiTtrain I(W) size=640(40), test I(W) size=640(40), multi-scale testing=true2021.11 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenSeeD (L)Type=Open-vocabulary, Backbone=Large, Image Size=1280x12802023.03 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-L + UperNetPre-training=BEIT + IN22k, Multi-scale testing=true2023.06 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-AdapterEncoder=BEIT-L2024.06 | 58.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SENSEBackbone=Swin-L, Synthetic Data Scale=2×2026.05 | 58.27 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former+IDRNetBackbone=Swin-Large, Stride=32x2023.10 | 58.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X-Decoder (L)Type=Open-vocabulary, Backbone=Large2023.03 | 58.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LFramework=UperNet, Backbone Pre-train=IN-22K, BEIT, Crop Size=640, Iters=160k, #Param=451M2022.05 | 58 | — | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LFramework=UperNet, Backbone Pre-train=IN-22K, BEiTv2, Crop Size=512, Iters=160k, #Param=451M2022.05 | 58 | — | 58.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MOAT-4Input size=641x641, Parameters=496.3M, FLOPs=1273.5B, Pre-training=ImageNet-22K2022.10 | 57.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HorNetCrop Size=640^22022.08 | 57.5 | — | 57.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HorNet-LFramework=Mask2Former, Backbone Pre-train=IN-22K, sup, Crop Size=640, Iters=160k2022.05 | 57.5 | — | 57.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEiTv2-LFramework=UperNet, Backbone Pre-train=IN-22K, BEiTv2, Crop Size=512, Iters=160k, #Param=441M2022.05 | 57.5 | — | 58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEiTv2-LParams=0.3 G, Pre-training Data=ImageNet22K, Teacher=CLIP, Segmenter=UperNet2023.09 | 57.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JoDiffusionBackbone=Swin-L, Synthetic Data Scale=2×, re-implemented=true2026.05 | 57.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerEncoder=Swin-L2024.06 | 57.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerEncoder=ConvNeXt-XL2024.06 | 57.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SegGenBackbone=Swin-L, Synthetic Data Scale=50×2026.05 | 57.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-L*Framework=Mask2Former, Backbone Pre-train=IN-22K, sup, Extra Pre-train=COCO-Stuff, sup, Crop Size=896, Iters=80k, #Param=434M2022.05 | 57.3 | — | 58.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-L + Mask2FormerPre-training=IN22k, Multi-scale testing=true2023.06 | 57.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-Large, Stride=32x2023.10 | 57.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SDSBackbone=Swin-L, Synthetic Data Scale=2×, re-implemented=true2026.05 | 57.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MOAT-4Input size=513x513, Parameters=496.3M, FLOPs=779.9B, Pre-training=ImageNet-22K2022.10 | 57.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskDINO + FDConvBackbone=Swin-L, Pre-trained=ImageNet-22K2025.03 | 57.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-XL*Framework=Mask2Former, Backbone Pre-train=IN-22K, sup, Extra Pre-train=COCO-Stuff, sup, Crop Size=896, Iters=80k, #Param=588M2022.05 | 57.1 | — | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Depth Anything V2Encoder=Base, Framework=Mask2Former2024.06 | 57.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeMask-L MSFaPN-Mask2FormerBackbone=SeMask Swin-L, Crop Size=640 × 6402021.12 | 57 | — | 58.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeMaskCrop Size=640^22022.08 | 57 | — | 58.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt V2-HBackbone=ConvNeXt V2-H, Pre-training=FCMAE, Extra-config=ImageNet-22K fine-tuning, input=640x640, #param=707M, FLOPS=5113G2023.01 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormer (L)Type=Closed-set, Backbone=Large2023.03 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeMask-Swin-LFramework=Mask2Former, Backbone Pre-train=IN-22K, sup, Crop Size=640, Iters=160k2022.05 | 57 | — | 58.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-L + UPerNetPre-training=BEIT + IN22k, Multi-scale testing=true2023.06 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UPerNetBackbone=BEIT-Large, Stride=16x2023.10 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MP-FormerBackbone=Swin-L, Pre-training=ImageNet-22K, Inference Scale=Single-scale2023.03 | 56.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeMask-L FaPN-Mask2FormerBackbone=SeMask Swin-L, Crop Size=640 × 6402021.12 | 56.88 | — | 58.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LFramework=Mask2Former, Backbone Pre-train=IN-22K, sup, Crop Size=640, Iters=160k, #Param=438M2022.05 | 56.8 | — | 57.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-L + UPerNetPre-training=BEIT + IN22k, Token reduction=0%, Im/sec=3.3, Multi-scale testing=true2023.06 | 56.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FaPNtrain I(W) size=640(7), test I(W) size=640(7), multi-scale testing=true2021.11 | 56.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GMMSegBackbone=SwinLarge, Base Architecture=Mask2Former2022.10 | 56.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-LFramework=UperNet, Backbone Pre-train=IN-22K, BEIT, Crop Size=640, Iters=160k, #Param=441M2022.05 | 56.7 | — | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-L + UPerNet + CTSPre-training=BEIT + IN22k, Token reduction=30%, Im/sec=5.4, Multi-scale testing=true2023.06 | 56.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskDINOBackbone=Swin-L, Pre-trained=ImageNet-22K2025.03 | 56.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MOAT-3Input size=641x641, Parameters=198.4M, FLOPs=554.7B, Pre-training=ImageNet-22K2022.10 | 56.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former + DejaVuBackbone=Swin-L2023.03 | 56.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaskDistill-LParams=0.3 G, Pre-training Data=ImageNet1K, Teacher=CLIP, Segmenter=UperNet2023.09 | 56.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeMask-L Mask2FormerBackbone=SeMask Swin-L, Crop Size=640 × 6402021.12 | 56.41 | — | 57.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-L FaPN-Mask2FormerBackbone=Swin-L, Crop Size=640 × 6402021.12 | 56.4 | — | 57.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-L-FaPNFramework=Mask2Former, Backbone Pre-train=IN-22K, sup, Crop Size=640, Iters=160k, #Param=217M2022.05 | 56.4 | — | 57.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerEncoder=Swin-L2024.06 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FreeMaskBackbone=Swin-L, Synthetic Data Scale=20×2026.05 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UperNetEncoder=BEIT-L2024.06 | 56.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LawinBackbone=Swin-L, Pre-training=ImageNet22K, FLOPs(G)=351, Input Crop Size=640x6402022.01 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-L Mask2FormerBackbone=Swin-L, Crop Size=640 × 6402021.12 | 56.1 | — | 57.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=SwinLarge2022.10 | 56.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former (L)Type=Closed-set, Backbone=Large2023.03 | 56.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-LFramework=Mask2Former, Backbone Pre-train=IN-22K, sup, Crop Size=640, Iters=160k, #Param=215M2022.05 | 56.1 | — | 57.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-L, Pre-training=ImageNet-22K, Inference Scale=Single-scale2023.03 | 56.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-L2023.03 | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-L MSFaPN-Mask2FormerBackbone=Swin-L, Crop Size=640 × 6402021.12 | 55.99 | — | 57.69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-LFramework=UperNet, train I(W) size=640(40), test I(W) size=640(40), multi-scale testing=true2021.11 | 55.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MOAT-3Input size=513x513, Parameters=198.4M, FLOPs=331.5B, Pre-training=ImageNet-22K2022.10 | 55.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-L + UPerNetPre-training=IN22k, Multi-scale testing=true2023.06 | 55.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3Arch=7B/16, Probe Type=Linear Probing, Backbone Status=Frozen, Resolution=560x5602026.02 | 55.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormerSupervision regime=Supervised, Notes=Fully supervised on each dataset2026.04 | 55.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSwin-Ltrain I(W) size=640(40), test I(W) size=640(40), multi-scale testing=true2021.11 | 55.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |