Semantic Segmentation on CamVid
83.7mIoUOurs_Segformer
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Ours_SegformerBackbone=Segformer, Training Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 83.7 | — | — | — | — | — | — | |
| Ours_HRNetBackbone=HRNet, Training Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 83.4 | — | — | — | — | — | — | |
| HRNet (Mappilary)Backbone=HRNet, Training Dataset=Mappilary, Evaluation Protocol=Zero-shot2022.02 | 82.5 | — | — | — | — | — | — | |
| MSegTraining Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 82.4 | — | — | — | — | — | — | |
| Zhu et al.Training Dataset=CamVid, Evaluation Protocol=Supervised2022.02 | 81.7 | — | — | — | — | — | — | |
| Teacher NetBackbone=ResNet101, #Params=68.1, Training/Inference Mode=Train on multi frames and infer on each frame independently, fps=4.12020.02 | 79.4 | — | — | 78.6 | — | — | — | |
| MobileNetV2+ALLBackbone=MobileNetV2, #Params=3.2, Training/Inference Mode=Train on multi frames and infer on each frame independently, fps=27.82020.02 | 78.2 | — | — | 77.9 | — | — | — | |
| PSPNetBackbone=ResNet101, #Params=68.1, Training/Inference Mode=Train and infer on each frame independently, fps=4.12020.02 | 77.6 | — | — | 77.1 | — | — | — | |
| MobileNetV2+TLBackbone=MobileNetV2, #Params=3.2, Training/Inference Mode=Train on multi frames and infer on each frame independently, fps=27.82020.02 | 76.3 | — | — | 77.6 | — | — | — | |
| DeepLabv3+ + OmniISRRemark=ResNet18 (Backbone), Setting=Centralized, OmniISR=✓2026.05 | 76.13 | — | — | — | 82.52 | 83.09 | 82.57 | |
| DeepLabv3+Remark=ResNet18 (Backbone), Setting=Centralized, OmniISR=✗2026.05 | 76.02 | — | — | — | 82.43 | 83.07 | 82.46 | |
| AdaptFormerImage type=Urban scene, Class=11, Image size=360 × 480, Random crop=256 × 256, Random cropping applied=false, Input image size=1024 × 10242024.08 | 74.8 | — | — | — | — | — | — | |
| MobileNetV2Backbone=MobileNetV2, #Params=3.2, Training/Inference Mode=Train and infer on each frame independently, fps=27.82020.02 | 74.4 | — | — | 76.8 | — | — | — | |
| SM-AdaptFormerImage type=Urban scene, Class=11, Image size=360 × 480, Random crop=256 × 256, Random cropping applied=false2024.08 | 73.99 | — | — | — | — | — | — | |
| DeepLabv3+ + OmniISRRemark=ResNet18 (Backbone), Setting=Federated, OmniISR=✓2026.05 | 73.24 | — | — | — | 80.7 | 81.6 | 80.34 | |
| DeepLabv3+Remark=ResNet18 (Backbone), Setting=Federated, OmniISR=✗2026.05 | 72.78 | — | — | — | 80.24 | 81.33 | 79.47 | |
| MoE-RAMbackbone=Frozen ViT2025.12 | 72.43 | — | — | — | 82.89 | 85.31 | 80.92 | |
| SKD-R18Backbone=ResNet18, #Params=15.2, Training/Inference Mode=Train and infer on each frame independently, fps=13.32020.02 | 72.3 | — | — | 75.4 | — | — | — | |
| NonLinearMoEbackbone=Frozen ViT2025.12 | 72.09 | — | — | — | 82.28 | 85.66 | 80.4 | |
| SoftMoEbackbone=Frozen ViT2025.12 | 71.54 | — | — | — | 81.71 | 85.2 | 79.54 | |
| LinearMoEbackbone=Frozen ViT2025.12 | 71.07 | — | — | — | 81.36 | 84.96 | 79.74 | |
| HRNet (BDD)Backbone=HRNet, Training Dataset=BDD, Evaluation Protocol=Zero-shot2022.02 | 71 | — | — | — | — | — | — | |
| HRNet (IDD)Backbone=HRNet, Training Dataset=IDD, Evaluation Protocol=Zero-shot2022.02 | 70.5 | — | — | — | — | — | — | |
| FANet-34Speed (fps)=1212020.07 | 70.1 | — | — | — | — | — | — | |
| FANet-18Speed (fps)=1542020.07 | 69 | — | — | — | — | — | — | |
| BiseNetSpeed (fps)=752020.07 | 68.7 | — | — | — | — | — | — | |
| ViT+ASSPbackbone=Frozen ViT2025.12 | 68.12 | — | — | — | 77.01 | — | — | |
| GSAMImage type=Urban scene, Class=11, Image size=360 × 480, Random crop=256 × 256, Random cropping applied=true2024.08 | 67.21 | — | — | — | — | — | — | |
| ICNetSpeed (fps)=822020.07 | 67.1 | — | — | — | — | — | — | |
| ConvLoRAImage type=Urban scene, Class=11, Image size=360 × 480, Random crop=256 × 256, Random cropping applied=false, Input image size=1024 × 10242024.08 | 66.96 | — | — | — | — | — | — | |
| AccelBackbone=ResNet101/18, Training/Inference Mode=Train and infer on multi frames, fps=7.12020.02 | 66.7 | — | — | 76.2 | — | — | — | |
| TopFormer + OmniISRRemark=Normal Transformer, Setting=Centralized, OmniISR=✓2026.05 | 66.38 | — | — | — | 74.5 | 77.47 | 73.6 | |
| GRFPBackbone=ResNet101, Training/Inference Mode=Train and infer on multi frames, fps=6.42020.02 | 66.1 | — | — | — | — | — | — | |
| DFFBackbone=ResNet101, Training/Inference Mode=Train and infer on multi frames, fps=16.12020.02 | 66 | — | — | 78 | — | — | — | |
| CEBackbone=DenseNet2012025.01 | 65.92 | — | — | — | — | — | — | |
| CEBackbone=ResNet342025.01 | 65.79 | — | — | — | — | — | — | |
| HRNet (Cityscapes)Backbone=HRNet, Training Dataset=Cityscapes, Evaluation Protocol=Zero-shot2022.02 | 65.3 | — | — | — | — | — | — | |
| LoRAImage type=Urban scene, Class=11, Image size=360 × 480, Random crop=256 × 256, Random cropping applied=false, Input image size=1024 × 10242024.08 | 65.2 | — | — | — | — | — | — | |
| HEMBackbone=EfficientNet-b42025.01 | 64.62 | — | — | — | — | — | — | |
| HRDA2025.12 | 64.42 | — | — | — | 75.65 | 83.66 | 71.8 | |
| CEBackbone=EfficientNet-b42025.01 | 64.21 | — | — | — | — | — | — | |
| TopFormerRemark=Normal Transformer, Setting=Centralized, OmniISR=✗2026.05 | 63.1 | — | — | — | 70.22 | 71.88 | 70.25 | |
| CEBackbone=ResNeXt502025.01 | 62.2 | — | — | — | — | — | — | |
| HEMBackbone=ResNeXt502025.01 | 61.88 | — | — | — | — | — | — | |
| HEMBackbone=ResNet342025.01 | 61.77 | — | — | — | — | — | — | |
| MMBackbone=DenseNet2012025.01 | 61.59 | — | — | — | — | — | — | |
| MMBackbone=EfficientNet-b42025.01 | 61.51 | — | — | — | — | — | — | |
| HEM-Backbone=EfficientNet-b42025.01 | 61.26 | — | — | — | — | — | — | |
| MMBackbone=ResNet342025.01 | 61.05 | — | — | — | — | — | — | |
| HEM-Backbone=DenseNet2012025.01 | 60.97 | — | — | — | — | — | — | |
| HEM-Backbone=ResNet342025.01 | 58.97 | — | — | — | — | — | — | |
| TopFormer + OmniISRRemark=Normal Transformer, Setting=Federated, OmniISR=✓2026.05 | 58.85 | — | — | — | 66.2 | 72.02 | 65.2 | |
| HEM-Backbone=ResNeXt502025.01 | 58.56 | — | — | — | — | — | — | |
| SAMImage type=Urban scene, Class=11, Image size=360 × 480, Random crop=256 × 256, Random cropping applied=false, Input image size=1024 × 10242024.08 | 58.27 | — | — | — | — | — | — | |
| DICEBackbone=DenseNet2012025.01 | 58.17 | — | — | — | — | — | — | |
| DICEBackbone=EfficientNet-b42025.01 | 58.02 | — | — | — | — | — | — | |
| DICEBackbone=ResNet342025.01 | 57.79 | — | — | — | — | — | — | |
| DICEBackbone=ResNeXt502025.01 | 56.74 | — | — | — | — | — | — | |
| HRNet (COCO)Backbone=HRNet, Training Dataset=COCO, Evaluation Protocol=Zero-shot2022.02 | 56.6 | — | — | — | — | — | — | |
| TopFormerRemark=Normal Transformer, Setting=Federated, OmniISR=✗2026.05 | 56.6 | — | — | — | 63.21 | 71.66 | 63.26 | |
| DeepLabv3+Image type=Urban scene, Class=11, Image size=360 × 480, Random crop=256 × 256, Random cropping applied=true, Input image size=1024 × 10242024.08 | 56.39 | — | — | — | — | — | — | |
| HEMBackbone=DenseNet2012025.01 | 55.89 | — | — | — | — | — | — | |
| SeaFormer + OmniISRRemark=Axial Transformer, Setting=Centralized, OmniISR=✓2026.05 | 55.83 | — | — | — | 62.39 | 64.19 | 62.54 | |
| SegNetSpeed (fps)=122020.07 | 55.6 | — | — | — | — | — | — | |
| HRNet (ADE)Backbone=HRNet, Training Dataset=ADE, Evaluation Protocol=Zero-shot2022.02 | 53.5 | — | — | — | — | — | — | |
| Full PrecisionPrecision=float32, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 53.34 | — | — | — | — | — | — | |
| MMBackbone=ResNeXt502025.01 | 53.07 | — | — | — | — | — | — | |
| FTPrecision=W8A8, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 52.76 | — | — | — | — | — | — | |
| SeaFormer + OmniISRRemark=Axial Transformer, Setting=Federated, OmniISR=✓2026.05 | 51.54 | — | — | — | 59.4 | 60.07 | 60.36 | |
| ENetSpeed (fps)=462020.07 | 51.3 | — | — | — | — | — | — | |
| AttaNet2025.12 | 51.12 | — | — | — | 58.89 | 58.83 | 60.96 | |
| DFQPrecision=W8A8, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 51.02 | — | — | — | — | — | — | |
| ZAQPrecision=W8A8, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 50.89 | — | — | — | — | — | — | |
| FTPrecision=W6A6, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 50.75 | — | — | — | — | — | — | |
| SeaFormerRemark=Axial Transformer, Setting=Centralized, OmniISR=✗2026.05 | 50.69 | — | — | — | 56 | 55.4 | 56.89 | |
| ZeroQPrecision=W8A8, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 49.92 | — | — | — | — | — | — | |
| U-NetImage type=Urban scene, Class=11, Image size=360 × 480, Random crop=256 × 256, Random cropping applied=true, Input image size=1024 × 10242024.08 | 49.79 | — | — | — | — | — | — | |
| ZAQPrecision=W6A6, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 49.77 | — | — | — | — | — | — | |
| FTPrecision=W4A4, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 49.13 | — | — | — | — | — | — | |
| ZeroQPrecision=W6A6, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 48.56 | — | — | — | — | — | — | |
| TopFormer2025.12 | 48.5 | — | — | — | 57.02 | 59.34 | 57.52 | |
| SAMUSImage type=Urban scene, Class=11, Image size=360 × 480, Random crop=256 × 256, Random cropping applied=false, Input image size=256 × 2562024.08 | 48.42 | — | — | — | — | — | — | |
| BiSecNetV22025.12 | 47.89 | — | — | — | 53.33 | — | — | |
| SeaFormer2025.12 | 47.85 | — | — | — | 56.62 | 56.22 | 58.65 | |
| ZAQPrecision=W4A4, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 47.62 | — | — | — | — | — | — | |
| ChainerCVImplementation=ChainerCV SegNet2017.08 | 47.2 | 82.8 | 67.1 | — | — | — | — | |
| SeaFormerRemark=Axial Transformer, Setting=Federated, OmniISR=✗2026.05 | 47.08 | — | — | — | 53.39 | 53.86 | 53.91 | |
| SegNet2025.12 | 46.6 | — | — | — | 50.18 | — | — | |
| SegNetImplementation=Original2017.08 | 46.3 | 82.7 | 62.3 | — | — | — | — | |
| DFQPrecision=W6A6, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 46.13 | — | — | — | — | — | — | |
| RQPrecision=W8A8, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 44.96 | — | — | — | — | — | — | |
| ZeroQPrecision=W4A4, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 43.83 | — | — | — | — | — | — | |
| LABackbone=EfficientNet-b42025.01 | 43.8 | — | — | — | — | — | — | |
| RQPrecision=W6A6, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 43.2 | — | — | — | — | — | — | |
| LABackbone=DenseNet2012025.01 | 40.72 | — | — | — | — | — | — | |
| FTPrecision=W2A2, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 40.06 | — | — | — | — | — | — | |
| ZAQPrecision=W2A2, Backbone=MobileNetV2, Architecture=DeepLabv32021.03 | 39.95 | — | — | — | — | — | — | |
| LABackbone=ResNet342025.01 | 39.61 | — | — | — | — | — | — | |
| SegFormer2025.12 | 39.37 | — | — | — | 46.23 | — | — | |
| LABackbone=ResNeXt502025.01 | 38.82 | — | — | — | — | — | — |