Semantic Segmentation on COCO 2017 (val)
68.1mIoUOneFormer
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OneFormerBackbone=DINAT-L [21], #Params=223M, Extra Data=false, Training Protocol=Joint Training2022.11 | 68.1 | — | |
| OneFormerBackbone=DINAT-L+, #Params=223M, #FLOPs=736G, #Queries=150, Epochs=1002022.11 | 68.1 | — | |
| Mask2Former-PanopticBackbone=Swin-L [38], #Params=216M, Extra Data=false, Training Protocol=Individual Training2022.11 | 67.4 | — | |
| OneFormerBackbone=Swin-L [38], #Params=219M, Extra Data=false, Training Protocol=Joint Training2022.11 | 67.4 | — | |
| Mask2Former-PanopticBackbone=Swin-L, #Params=216M, #FLOPs=875G, #Queries=200, Epochs=1002022.11 | 67.4 | — | |
| OneFormerBackbone=Swin-L+, #Params=219M, #FLOPs=891G, #Queries=150, Epochs=1002022.11 | 67.4 | — | |
| Mask2Former-Semantic+Backbone=Swin-L, #Params=216M, #FLOPs=891G, #Queries=200, Epochs=1002022.11 | 67.2 | — | |
| UniMatch V2Labeled Data (# Img)=118K, Unlabeled Data (# Img)=123K (COCO Extra)2024.10 | 67.1 | — | |
| HIPIEBackbone=ViT-H2023.07 | 66.8 | — | |
| Supervised BaselineLabeled Data (# Img)=118K, Unlabeled Data (# Img)=02024.10 | 66.4 | — | |
| ODISE2023.07 | 65.2 | — | |
| MaskFormerBackbone=Swin-L, #Params=212M, #FLOPs=792G, #Queries=100, Epochs=3002022.11 | 64.8 | — | |
| Lite-ECO-M2FBackbone=SWIN-T, Total GFLOPs=178.43, Encoder GFLOPs=64.422024.04 | 63.23 | — | |
| Lite-M2FBackbone=SWIN-T, Total GFLOPs=188.00, Encoder GFLOPs=79.782024.04 | 63.08 | — | |
| DeepLab-50 (ANN)Arch.=DeepLab-50, Mode=ANN2024.09 | 63.01 | — | |
| ECO-M2F (β = 0.0005)Backbone=SWIN-T, Total GFLOPs=202.39, Encoder GFLOPs=88.472024.04 | 62.76 | — | |
| ANN-SNN conversion algorithmArch.=DeepLab-50, Inference Step=2562024.09 | 62.61 | — | |
| M2FBackbone=SWIN-T, Total GFLOPs=235.57, Encoder GFLOPs=121.692024.04 | 62.49 | — | |
| ECO-M2F (β = 0.02)Backbone=SWIN-T, Total GFLOPs=181.64, Encoder GFLOPs=67.712024.04 | 62.25 | — | |
| M2FBackbone=Res50, Total GFLOPs=229.10, Encoder GFLOPs=135.002024.04 | 61.94 | — | |
| RT-M2FBackbone=SWIN-T, Total GFLOPs=158.30, Encoder GFLOPs=59.662024.04 | 61.54 | — | |
| ANN-SNN conversion algorithmArch.=DeepLab-50, Inference Step=1282024.09 | 61.52 | — | |
| ECO-M2FBackbone=Res50, Total GFLOPs=195.55, Encoder GFLOPs=92.372024.04 | 61.07 | — | |
| FCN-50 (ANN)Arch.=FCN-50, Mode=ANN2024.09 | 60.67 | — | |
| ANN-SNN conversion algorithmArch.=FCN-50, Inference Step=2562024.09 | 59.53 | — | |
| HIPIEBackbone=RN502023.07 | 59.5 | — | |
| YOSOBackbone=Res50, Total GFLOPs=114.502024.04 | 58.74 | — | |
| Mask2FormerSegmenter=Mask2Former, Backbone=ResNet50, Training set=COCO's training (2017: 118k images)2023.09 | 57.8 | — | |
| MFBackbone=Res50, Total GFLOPs=181.002024.04 | 57.8 | — | |
| ANN-SNN conversion algorithmArch.=FCN-50, Inference Step=1282024.09 | 57.01 | — | |
| ANN-SNN conversion algorithmArch.=DeepLab-50, Inference Step=642024.09 | 56.62 | — | |
| PEMBackbone=Res50, Total GFLOPs=110.902024.04 | 55.95 | — | |
| UPSNetMulti-scale=true, Run Time (ms)=24332019.01 | 55.7 | — | |
| MR-CNN-PSPMulti-scale=true, Run Time (ms)=36242019.01 | 55.3 | — | |
| LSeg+Backbone=RN502023.07 | 55.1 | — | |
| DeepLabV3Segmenter=DeepLabV3, Backbone=ResNet101, Training set=COCO's training (2017: 118k images)2023.09 | 54.9 | — | |
| UPSNet-CMulti-scale=false, Run Time (ms)=1532019.01 | 54.5 | — | |
| UPSNet-CPMulti-scale=false, Run Time (ms)=1532019.01 | 54.3 | — | |
| UPSNetMulti-scale=false, Run Time (ms)=1672019.01 | 54.3 | — | |
| MR-CNN-PSPMulti-scale=false, Run Time (ms)=1862019.01 | 53.9 | — | |
| ANN-SNN conversion algorithmArch.=FCN-50, Inference Step=642024.09 | 50.38 | — | |
| DeepLabV3Segmenter=DeepLabV3, Backbone=ResNet50, Training set=COCO's training (2017: 118k images)2023.09 | 48.9 | — | |
| SynthSeg-AgentsTrain Set=Synthetic + COCO, Number=80k + 80k, Backbone=ViT-B, Training Protocol=Finetune with Real Data2025.12 | 47.8 | — | |
| SecoTrain Set=COCO, Number=80k (all), Backbone=ViT-B, Training Protocol=Train with Pure Real Data (WSSS)2025.12 | 46.7 | — | |
| IAATrain Set=COCO, Number=80k (all), Backbone=ViT-B, Training Protocol=Train with Pure Real Data (WSSS)2025.12 | 45.8 | — | |
| APCTrain Set=COCO, Number=80k (all), Backbone=ViT-B, Training Protocol=Train with Pure Real Data (WSSS)2025.12 | 45.7 | — | |
| BlendMaskBackbone=R-1012020.01 | 44.9 | — | |
| SFCTrain Set=COCO, Number=80k (all), Backbone=ViT-B, Training Protocol=Train with Pure Real Data (WSSS)2025.12 | 44.6 | — | |
| Panoptic-FPNBackbone=R-1012020.01 | 44.5 | — | |
| SIPETrain Set=COCO, Number=80k (all), Backbone=ViT-B, Training Protocol=Train with Pure Real Data (WSSS)2025.12 | 43.6 | — | |
| BlendMaskBackbone=R-502020.01 | 43.5 | — | |
| Panoptic-FPNBackbone=R-502020.01 | 42.9 | — | |
| ToCoTrain Set=COCO, Number=80k (all), Backbone=ViT-B, Training Protocol=Train with Pure Real Data (WSSS)2025.12 | 42.3 | — | |
| TSCDTrain Set=COCO, Number=80k (all), Backbone=MiT-B1, Training Protocol=Train with Pure Real Data (WSSS)2025.12 | 40.1 | — | |
| ANN-SNN conversion algorithmArch.=DeepLab-50, Inference Step=322024.09 | 39.02 | — | |
| OpenSeg2023.07 | 36.1 | — | |
| Dataset DiffusionSegmenter=DeepLabV3, Backbone=ResNet101, Training set=Dataset Diffusion (80k images)2023.09 | 34.2 | — | |
| Dataset DiffusionSegmenter=DeepLabV3, Backbone=ResNet50, Training set=Dataset Diffusion (80k images)2023.09 | 32.4 | — | |
| Dataset DiffusionSegmenter=Mask2Former, Backbone=ResNet50, Training set=Dataset Diffusion (80k images)2023.09 | 31 | — | |
| U2SegBackbone=ResNet-502023.12 | 30.2 | 63.9 | |
| SynthSeg-AgentsTrain Set=Synthetic, Number=80k, Backbone=ViT-B, Training Protocol=Train with Pure Synthetic Data2025.12 | 30.2 | — | |
| ANN-SNN conversion algorithmArch.=FCN-50, Inference Step=322024.09 | 28.66 | — | |
| STEGO2023.12 | 28.2 | 56.9 | |
| GroupViT2023.07 | 21.1 | — | |
| PiCIE + H2023.12 | 13.8 | 48.1 | |
| DINO2023.12 | 9.6 | 30.5 |