Semantic Segmentation on CamVid (test)
90.4mIoUSegNet
Evaluation Results
| Method | Links | ||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SegNetTraining dataset size=3.5K, Training iterations=140K2015.11 | 90.4 | 89.6 | 83.4 | 95.1 | 87.7 | 52.7 | 96.4 | 62.2 | 53.45 | 3,210 | 93.3 | 36.5 | 71.2 | 46.84 | — | — | — | — | — | — | — | — | |
| HRNet + BANELoss=L_CE + L_PA (Ours), Sampling=Boundary-aware (Ours)2024.04 | 84.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OCRNet + BANELoss=L_CE + L_PA (Ours), Sampling=Boundary-aware (Ours)2024.04 | 84.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OCRNet + [31]Loss=L_CE + L_ems + L_ccs, Sampling=Random2024.04 | 83.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Boosting + Higher orderCRF based=true2015.11 | 83.8 | 84.5 | 72.6 | 97.5 | 72.7 | 34.1 | 95.3 | 34.2 | 45.7 | 810 | 77.6 | 28.5 | 59.2 | — | — | — | — | — | — | — | — | — | |
| Boosting + Detectors + CRFCRF based=true2015.11 | 83.8 | 81.5 | 76.6 | 96.2 | 78.7 | 40.2 | 93.9 | 43 | 47.6 | 1,430 | 81.5 | 33.9 | 62.5 | — | — | — | — | — | — | — | — | — | |
| Super Parsing2015.11 | 83.3 | 87 | 67.1 | 96.9 | 62.7 | 30.1 | 95.9 | 14.7 | 17.9 | 170 | 70 | 19.4 | 51.2 | — | — | — | — | — | — | — | — | — | |
| HRNet + [31]Loss=L_CE + L_ems + L_ccs, Sampling=Random2024.04 | 83.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video Propagation + Label RelaxationInference scale=Multi-scale2018.12 | 82.9 | 91.2 | 83.4 | 93.1 | 93.9 | 71.5 | 97.7 | 79.2 | 76.8 | 54.7 | 91.3 | 79.7 | — | — | — | — | — | — | — | — | — | — | |
| OCRNetLoss=L_CE, Sampling=None2024.04 | 82.69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RTFormer-Base#Params=16.8M, GPU=RTX 2080Ti, Resolution=720x9602022.10 | 82.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 94 | — | — | — | — | — | |
| HRNetLoss=L_CE, Sampling=None2024.04 | 82.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Dense Depth Maps2015.11 | 82.1 | 85.3 | 57.3 | 95.4 | 69.2 | 46.5 | 98.5 | 23.8 | 44.3 | 2,200 | 38.1 | 28.7 | 55.4 | — | — | — | — | — | — | — | — | — | |
| Neural Decision Forests2015.11 | 82.1 | — | — | — | — | — | — | — | — | — | — | — | 56.1 | — | — | — | — | — | — | — | — | — | |
| PIDNet-S-Wider#FPS=85.6, GPU=RTX 3090, Pre-trained=Cityscapes2022.06 | 82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OursPre-train=Cityscapes, Encoder=WideResNet382018.12 | 81.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video Propagation + Label RelaxationInference scale=Single-scale2018.12 | 81.7 | 90.9 | 82.9 | 92.8 | 94.2 | 69.9 | 97.7 | 76.2 | 74.7 | 51 | 91.1 | 78 | — | — | — | — | — | — | — | — | — | — | |
| RTFormer-Slim#Params=4.8M, GPU=RTX 2080Ti, Resolution=720x9602022.10 | 81.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 190.7 | — | — | — | — | — | |
| P2AT-LBackbone=ResNet-50, Resolution=720x960, Params=37.5, Speed (FPS)=56.1, Pre-trained on Cityscapes=true2023.10 | 81.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| P2AT-MBackbone=ResNet-34, Resolution=720x960, Params=22.7, Speed (FPS)=86.6, Pre-trained on Cityscapes=true2023.10 | 81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DDRNet-23#FPS=116.8, GPU=RTX 3090, Pre-trained=Cityscapes, Testing Platform=Current paper platform2022.06 | 80.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DDRNet-23Pre-training=Cityscapes, Speed (FPS)=94, GPU=GTX 2080Ti, Input Resolution=960x7202021.01 | 80.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GAINBackbone=ResNet-18, Resolution=720 x 960, Pre-training=Cityscapes pre-trained weights2026.01 | 80.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 64.5 | — | — | — | — | — | |
| P2AT-SBackbone=ResNet-18, Resolution=720x960, Params=12.6, Speed (FPS)=113.6, Pre-trained on Cityscapes=true2023.10 | 80.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PIDNet-S#FPS=153.7, GPU=RTX 3090, Pre-trained=Cityscapes2022.06 | 80.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepLabV3 + BANELoss=L_CE + L_PA (Ours), Sampling=Boundary-aware (Ours)2024.04 | 79.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Boosting + pairwise CRFCRF based=true2015.11 | 79.8 | 70.7 | 70.8 | 94.7 | 74.4 | 55.9 | 94.1 | 45.7 | 37.2 | 1,300 | 79.3 | 23.1 | 59.9 | — | — | — | — | — | — | — | — | — | |
| Ours (baseline)Pre-train=Cityscapes, Encoder=WideResNet382018.12 | 79.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepLabV3 + [31]Loss=L_CE + L_ems + L_ccs, Sampling=Random2024.04 | 79.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CCNet3DBackbone=ResNet101, Recurrent Steps (T)=5, Pre-trained=Cityscapes2018.11 | 79.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-LBackbone=EfficientNet-B1, Resolution=1024x768, FPS=16.6, Params (M)=10.22020.12 | 79.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-L#FPS=16.6, GPU=GTX 1080Ti2022.06 | 79.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CCNet3DExtra data=Cityscapes2021.11 | 79.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-LBackbone=EfficientNet-B1, Resolution=720x960, Params=10.2, Speed (FPS)=16.6, Pre-trained on Cityscapes=false2023.10 | 79.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CCNet3DPre-training=Cityscapes, Input Resolution=960x7202021.01 | 79.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-LBackbone=EfficientNet-B1, Resolution=720 x 9602026.01 | 79.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 16.6 | — | — | — | — | — | |
| DeepLabV3Loss=L_CE, Sampling=None2024.04 | 78.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DDRNet-23-S#FPS=182.4, GPU=RTX 3090, Pre-trained=Cityscapes, Testing Platform=Current paper platform2022.06 | 78.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DDRNet-23-slimPre-training=Cityscapes, Speed (FPS)=230, GPU=GTX 2080Ti, Input Resolution=960x7202021.01 | 78.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiSeNet V2-Lbackbone=none, input resolution=960x720, pre-trained on Cityscapes=true2020.04 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 32.7 | — | — | — | — | — | |
| BiSeNetV2-L#FPS=33, GPU=GTX 1080Ti, Pre-trained=Cityscapes2022.06 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiSeNetV2-LExtra data=Cityscapes2021.11 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 33 | — | — | — | |
| BiSeNetV2-LBackbone=no, Resolution=720x960, Params=32.7, Pre-trained on Cityscapes=true2023.10 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiSeNetV2-LPre-training=Cityscapes, Speed (FPS)=33, GPU=GTX 1080Ti, Input Resolution=960x720, TensorRT Acceleration=true2021.01 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-L w/o DPWConvBackbone=EfficientNet-B1, Resolution=1024x768, FPS=21.6, Params (M)=10.32020.12 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-SBackbone=EfficientNet-B1, Resolution=768x576, FPS=38.0, Params (M)=9.92020.12 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-SBackbone=EfficientNet-B1, Implementation Source=open-source implementation, Pre-training=ImageNet (no Cityscapes), Hardware=Nvidia GTX 1080 Ti2020.11 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 38 | 6.3 | — | — | — | — | |
| HyperSeg-S#FPS=38, GPU=GTX 1080Ti2022.06 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-SExtra data=ImageNet2021.11 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 38 | — | — | — | |
| HyperSeg-SBackbone=EfficientNet-B1, Resolution=720x960, Params=9.9, Speed (FPS)=38, Pre-trained on Cityscapes=false2023.10 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-MBackbone=EfficientNet-B1, Resolution=720 x 9602026.01 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 38 | — | — | — | — | — | |
| RDRNetResolution=720 x 9602026.01 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 49.2 | — | — | — | — | — | |
| CCNet3DBackbone=ResNet101, Recurrent Steps (T)=1, Pre-trained=Cityscapes2018.11 | 77.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-LBackbone=PSPNet50, Resolution=1024x768, FPS=2.2, Params (M)=67.92020.12 | 77.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-LBackbone=PSPNet18, Resolution=1024x768, FPS=11.4, Params (M)=17.62020.12 | 77.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-S w/o DPWConvBackbone=EfficientNet-B1, Resolution=768x576, FPS=45.5, Params (M)=9.92020.12 | 77.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-LBackbone=ResNet18, Resolution=1024x768, FPS=11.5, Params (M)=16.72020.12 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-SBackbone=PSPNet50, Resolution=768x576, FPS=9.3, Params (M)=57.62020.12 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiAlignNet*Backbone=DFNet2, FPS=65, Cityscapes Pre-trained=true2021.05 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-SBackbone=ResNet18, Resolution=768x576, FPS=32.5, Params (M)=16.22020.12 | 77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-SBackbone=ResNet-18, Pre-training=ImageNet (no Cityscapes), Hardware=Nvidia GTX 1080 Ti2020.11 | 77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 32.5 | — | — | — | — | — | |
| BiSeNet V2backbone=none, input resolution=960x720, pre-trained on Cityscapes=true2020.04 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 124.5 | — | — | — | — | — | |
| BiSeNetv2*FPS=60, Cityscapes Pre-trained=true2021.05 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiSeNetV2#FPS=124, GPU=GTX 1080Ti, Pre-trained=Cityscapes2022.06 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiSeNetV2Extra data=Cityscapes2021.11 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 124 | — | — | — | |
| BiSeNetV2Backbone=no, Resolution=720x960, Speed (FPS)=124.5, Pre-trained on Cityscapes=false2023.10 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiSeNetV2Pre-training=Cityscapes, Speed (FPS)=124, GPU=GTX 1080Ti, Input Resolution=960x720, TensorRT Acceleration=true2021.01 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperSeg-SBackbone=PSPNet18, Resolution=768x576, FPS=31.3, Params (M)=17.22020.12 | 76.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Boosting2015.11 | 76.4 | 61.9 | 67.3 | 91.1 | 71.1 | 58.5 | 92.9 | 49.5 | 37.6 | 2,580 | 77.8 | 24.7 | 59.8 | — | — | — | — | — | — | — | — | — | |
| DDRNet-23#Params=20.1M, GPU=RTX 2080Ti, Resolution=720x9602022.10 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 97.1 | — | — | — | — | — | |
| DDRNet-23Pre-training=None, Speed (FPS)=94, GPU=GTX 2080Ti, Input Resolution=960x7202021.01 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TD2-PSP50Backbone=PSPNet50, FPS=11.12020.12 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TD2-PSP50#FPS=11, GPU=TITAN X2022.06 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SVCNet2019.09 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MSFNet#FPS=91, GPU=GTX 2080Ti2022.06 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MSFNetExtra data=ImageNet2021.11 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 91 | — | — | — | |
| MSFNetPre-training=None, Speed (FPS)=91, GPU=GTX 2080Ti, Input Resolution=1024x7682021.01 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Basenet + 3-Frame VideoGCRFBackbone=ResNet-101, Cityscapes Pretraining=true, Temporal Context=3-Frame2018.07 | 75.2 | 86.1 | 78.3 | 91.2 | 92.2 | 63.7 | 96.4 | 67.3 | 63 | 34.4 | 87.8 | 66.4 | — | — | — | — | — | — | — | — | — | — | |
| VideoGCRFPre-train=Cityscapes, Encoder=ResNet1012018.12 | 75.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoGCRF2018.12 | 75.2 | 86.1 | 78.3 | 91.2 | 92.2 | 63.7 | 96.4 | 67.3 | 63 | 34.4 | 87.8 | 66.4 | — | — | — | — | — | — | — | — | — | — | |
| VideoGCRFbackbone=ResNet101, input resolution=960x720, pre-trained on Cityscapes=true2020.04 | 75.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoGCRFBackbone=ResNet101, Pre-trained=Cityscapes2018.11 | 75.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoGCRFExtra data=Cityscapes2021.11 | 75.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoGCRFPre-training=Cityscapes, Input Resolution=960x7202021.01 | 75.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwiftNet-EffL1Backbone=EfficientNet-L1, Implementation=our implementation, Pre-training=ImageNet (no Cityscapes), Hardware=Nvidia GTX 1080 Ti2020.11 | 75.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 48 | 13.4 | — | — | — | — | |
| Basenet + 2-Frame VideoGCRFBackbone=ResNet-101, Cityscapes Pretraining=true, Temporal Context=2-Frame2018.07 | 75 | 86 | 78.3 | 91.2 | 92 | 63.4 | 96.3 | 67 | 62.5 | 34.4 | 87.7 | 66.1 | — | — | — | — | — | — | — | — | — | — | |
| PP-LiteSeg-BEncoder=STDC2, Input Resolution=960x7202022.04 | 75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 154.8 | — | — | — | — | — | |
| PP-LiteSeg-T#FPS=154.8, GPU=GTX 1080Ti2022.06 | 75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepLab-ASPPSupervision=Full supervision2023.12 | 74.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DDRNet-23-Slim#Params=5.7M, GPU=RTX 2080Ti, Resolution=720x9602022.10 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 217 | — | — | — | — | — | |
| DDRNet-23-slimPre-training=None, Speed (FPS)=230, GPU=GTX 2080Ti, Input Resolution=960x7202021.01 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Basenet + Spatial CRFBackbone=ResNet-101, Cityscapes Pretraining=true2018.07 | 74.6 | 86 | 77.8 | 91.2 | 90.8 | 63.6 | 95.9 | 66.5 | 61.2 | 35.3 | 86.9 | 65.8 | — | — | — | — | — | — | — | — | — | — | |
| SegBlocks-EffL1Backbone=EfficientNet-L1, Threshold (τ)=0.4, Pre-training=ImageNet (no Cityscapes), Hardware=Nvidia GTX 1080 Ti2020.11 | 74.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 58 | 9.1 | — | — | — | — | |
| GAINBackbone=ResNet-18, Resolution=720 x 9602026.01 | 74.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 64.5 | — | — | — | — | — | |
| S2-FPN34MParams M=27.9, Speed (FPS)=55.5, Pre-trained on Cityscapes=true2022.06 | 74.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GAINBackbone=DF-2, Resolution=720 x 9602026.01 | 74.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 92.3 | — | — | — | — | — | |
| Multi Scale Spatial Attention NetworkInput Resolution=512x768, Frame(fps)=1242020.06 | 74.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BFP2019.08 | 74.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Basenet + denseCRF post-processingBackbone=ResNet-101, Cityscapes Pretraining=true2018.07 | 73.9 | 84.3 | 76.1 | 90.5 | 88.9 | 65.1 | 95.4 | 65.4 | 61.5 | 34.1 | 85.8 | 66.2 | — | — | — | — | — | — | — | — | — | — | |
| STDC2-SegResolution=720 x 960, Backbone=STDC2, FPS=152.22021.04 | 73.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |