Semantic Segmentation on Cityscapes
3,290mIoUNACLIP + ResCLIP
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| NACLIP + ResCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 3,290 | — | — | — | — | — | — | 3,790 | |
| ClearCLIP + ResCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 3,230 | — | — | — | — | — | — | 3,840 | |
| NACLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 3,230 | — | — | — | — | — | — | 3,530 | |
| SCLIP + ResCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 3,190 | — | — | — | — | — | — | 3,550 | |
| ClearCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 3,180 | — | — | — | — | — | — | 3,790 | |
| SCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 3,140 | — | — | — | — | — | — | 3,390 | |
| OpenCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 510 | — | — | — | — | — | — | 1,384 | |
| Depth Anything V2Encoder=Large2024.06 | 85.6 | — | — | — | — | — | — | — | |
| SegMAN-LParams (M)=92.4, GFLOPS=796, FPS=5.2, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 84.2 | — | — | — | — | — | — | — | |
| Depth Anything V2Encoder=Base2024.06 | 83.9 | — | — | — | — | — | — | — | |
| SegMAN-BParams (M)=51.8, GFLOPS=479, FPS=7.2, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 83.8 | — | — | — | — | — | — | — | |
| OneFormerEncoder=ConvNeXt-XL2024.06 | 83.6 | — | — | — | — | — | — | — | |
| Swin-LBackbone=Swin-L, Resolution=1024×2048, Latency (ms)=329.52023.03 | 83.3 | — | — | — | — | — | — | — | |
| Mask2FormerEncoder=Swin-L2024.06 | 83.3 | — | — | — | — | — | — | — | |
| Mask2Former (Swin-L)Additions=Pixel Decoder2026.01 | 83.3 | — | — | — | — | — | — | — | |
| SparseViTBackbone=SparseViT (Ours), Resolution=1024×2048, Latency (ms)=250.62023.03 | 83.2 | — | — | — | — | — | — | — | |
| DDPEncoder=ConvNeXt-L2024.06 | 83.2 | — | — | — | — | — | — | — | |
| SegMAN-SParams (M)=29.4, GFLOPS=218.4, FPS=13.8, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 83.2 | — | — | — | — | — | — | — | |
| SegNext-LParams (M)=48.9, GFLOPS=577.5, FPS=10.1, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 83.2 | — | — | — | — | — | — | — | |
| OneFormerEncoder=Swin-L2024.06 | 83 | — | — | — | — | — | — | — | |
| Depth Anything V2Encoder=Small2024.06 | 82.9 | — | — | — | — | — | — | — | |
| Swin-L (R896)Backbone=Swin-L (R896), Resolution=896×1792, Latency (ms)=256.52023.03 | 82.8 | — | — | — | — | — | — | — | |
| SegNext-BParams (M)=27.6, GFLOPS=279.1, FPS=14.1, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 82.6 | — | — | — | — | — | — | — | |
| DDPEncoder=Swin-B2024.06 | 82.5 | — | — | — | — | — | — | — | |
| DDPEncoder=Swin-S2024.06 | 82.4 | — | — | — | — | — | — | — | |
| SegFormerEncoder=MiT-B52024.06 | 82.4 | — | — | — | — | — | — | — | |
| VWFormer-B3Params (M)=47.3, GFLOPS=637.1, FPS=6.3, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 82.4 | — | — | — | — | — | — | — | |
| VWFormer-B5Params (M)=84.6, GFLOPS=1139.6, FPS=3.7, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 82.4 | — | — | — | — | — | — | — | |
| Segformer (MiT-B5)Additions=MLP Decoder2026.01 | 82.4 | — | — | — | — | — | — | — | |
| SegmenterEncoder=ViT-L2024.06 | 82.2 | — | — | — | — | — | — | — | |
| VWFormer-B2Params (M)=27.4, GFLOPS=415.1, FPS=9.87, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 81.7 | — | — | — | — | — | — | — | |
| Segformer-B3Params (M)=46.3, GFLOPS=962.9, FPS=6.7, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 81.7 | — | — | — | — | — | — | — | |
| Segformer-B5Params (M)=84.7, GFLOPS=1460.4, FPS=3.5, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 81.7 | — | — | — | — | — | — | — | |
| X-Decoder (DaViT-d5)Additions=X-Decoder2026.01 | 81.7 | — | — | — | — | — | — | — | |
| EDAFormer-BParams (M)=29.4, GFLOPS=605.9, FPS=6.6, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 81.6 | — | — | — | — | — | — | — | |
| DINOv3Param.=7B, Patch Size=16, Evaluation Protocol=Linear probe, Input Resolution=Default2026.03 | 81.1 | — | — | — | — | — | — | — | |
| Segformer-B2Params (M)=27.5, GFLOPS=717.1, FPS=10.2, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 81 | — | — | — | — | — | — | — | |
| PIDNet-LFPS=31.1, FLOPs=276G, Params=36.9M2024.02 | 80.9 | — | — | — | — | — | — | — | |
| AutoUniSeg (Ours)Backbone=HRNet-W48, Label space=Auto2024.07 | 80.7 | — | — | — | — | — | — | — | |
| UPerNetBackbone=RedNet-50, #Params (M)=56.4, FLOPs (G)=1825.62021.03 | 80.6 | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Axial-DeepLab-XL, #Params (M)=173.0, FLOPs (G)=2446.82021.03 | 80.6 | — | — | — | — | — | — | — | |
| OCRNetBackbone=HRNetV2p-W48, Resolution=1024x5122020.08 | 80.6 | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Axial-DeepLab-S, #Params (M)=12.1, FLOPs (G)=220.82021.03 | 80.5 | — | — | — | — | — | — | — | |
| DNLBackbone=ResNet-101, Resolution=1024x5122020.08 | 80.4 | — | — | — | — | — | — | — | |
| Mask2Former + FDConvBackbone=ResNet-502025.03 | 80.4 | — | — | — | — | — | — | — | |
| EQ-VMamba-SBackbone=EQ-VMamba-S, #Param. (M)=25M2026.03 | 80.36 | — | — | — | — | — | — | — | |
| Panoptic-DeepLabBackbone=Axial-DeepLab-M, #Params (M)=25.9, FLOPs (G)=419.62021.03 | 80.3 | — | — | — | — | — | — | — | |
| SegMAN-TParams (M)=6.4, GFLOPS=52.5, FPS=34.9, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 80.3 | — | — | — | — | — | — | — | |
| CGRSeg-BParams (M)=35.6, GFLOPS=199, FPS=11.8, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 80.2 | — | — | — | — | — | — | — | |
| PIDNet-MFPS=39.8, FLOPs=197G, Params=34.4M2024.02 | 80.1 | — | — | — | — | — | — | — | |
| PEMBackbone=R50, FPS=13.8, FLOPs=240G, Params=35.6M2024.02 | 79.9 | — | — | — | — | — | — | — | |
| SePiCo (ProtoCL)Backbone=MiT-B52022.04 | 79.5 | — | — | — | — | — | — | — | |
| SePiCo (ProtoCL)Backbone=MiT-B52022.04 | 79.5 | — | — | — | — | — | — | — | |
| DDRNet-23FPS=51.4, FLOPs=143G, Params=20.1M2024.02 | 79.5 | — | — | — | — | — | — | — | |
| Multi-SegHeadBackbone=HRNet-W48, Label space=DS2024.07 | 79.5 | — | — | — | — | — | — | — | |
| DINOv3 ViT-H+Param.=0.8B, Patch Size=16, Evaluation Protocol=Linear probe, Input Resolution=Default2026.03 | 79.5 | — | — | — | — | — | — | — | |
| DeepLabV3+Backbone=ResNet-101, Resolution=1024x5122020.08 | 79.4 | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=R50, FPS=6.6, FLOPs=523G, Params=44.0M2024.02 | 79.4 | — | — | — | — | — | — | — | |
| YOSOBackbone=R50, FPS=11.1, FLOPs=268G, Params=42.6M2024.02 | 79.4 | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=ResNet-502025.03 | 79.4 | — | — | — | — | — | — | — | |
| DNLBackbone=ResNet-50, Resolution=1024x5122020.08 | 79.3 | — | — | — | — | — | — | — | |
| VMamba-SBackbone=VMamba-S, #Param. (M)=82M2026.03 | 79.03 | — | — | — | — | — | — | — | |
| DeepLabV3+Backbone=ResNet-50, Resolution=1024x5122020.08 | 79 | — | — | — | — | — | — | — | |
| PEMBackbone=STDC2, FPS=22.0, FLOPs=118G, Params=21.0M2024.02 | 79 | — | — | — | — | — | — | — | |
| SePiCo (BankCL)Backbone=MiT-B52022.04 | 78.9 | — | — | — | — | — | — | — | |
| SePiCo (DistCL)Backbone=MiT-B52022.04 | 78.9 | — | — | — | — | — | — | — | |
| SePiCo (BankCL)Backbone=MiT-B52022.04 | 78.9 | — | — | — | — | — | — | — | |
| SePiCo (DistCL)Backbone=MiT-B52022.04 | 78.9 | — | — | — | — | — | — | — | |
| SegNext-TParams (M)=4.3, GFLOPS=61.6, FPS=25.8, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 78.9 | — | — | — | — | — | — | — | |
| PIDNet-SFPS=93.2, FLOPs=46G, Params=7.6M2024.02 | 78.8 | — | — | — | — | — | — | — | |
| PSPNet2018.05 | 78.7 | 60.4 | — | — | — | — | — | — | |
| EDAFormer-TParams (M)=4.9, GFLOPS=151.7, FPS=12.7, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 78.7 | — | — | — | — | — | — | — | |
| SupArchitecture=DeepLab-v32021.10 | 78.6 | — | — | — | — | — | — | — | |
| Moco-v2Architecture=DeepLab-v32021.10 | 78.6 | — | — | — | — | — | — | — | |
| MaskFormerBackbone=R101, FPS=10.1, FLOPs=559G, Params=60.2M2024.02 | 78.5 | — | — | — | — | — | — | — | |
| VMamba-TBackbone=VMamba-T, #Param. (M)=62M2026.03 | 78.42 | — | — | — | — | — | — | — | |
| MSVMamba-MBackbone=MSVMamba-M, #Param. (M)=42M2026.03 | 78.4 | — | — | — | — | — | — | — | |
| AM-RADIOv2.5Param.=1B, Patch Size=14, Evaluation Protocol=Linear probe, Input Resolution=Default2026.03 | 78.4 | — | — | — | — | — | — | — | |
| MSVMamba-TBackbone=MSVMamba-T, #Param. (M)=65M2026.03 | 78.35 | — | — | — | — | — | — | — | |
| PEMBackbone=STDC1, FPS=24.3, FLOPs=92G, Params=17.0M2024.02 | 78.3 | — | — | — | — | — | — | — | |
| CGRSeg-TParams (M)=9.3, GFLOPS=65.5, FPS=27.6, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 78.3 | — | — | — | — | — | — | — | |
| UPerNetBackbone=ResNet-50, #Params (M)=66.4, FLOPs (G)=1894.52021.03 | 78.2 | — | — | — | — | — | — | — | |
| EQ-VMamba-TBackbone=EQ-VMamba-T, #Param. (M)=18M2026.03 | 78.01 | — | — | — | — | — | — | — | |
| BaselineBackbone=ResNet-502022.04 | 77.93 | — | — | — | — | — | — | — | |
| SimCLRArchitecture=DeepLab-v32021.10 | 77.8 | — | — | — | — | — | — | — | |
| DDRNet-23-SFPS=108.1, FLOPs=36G, Params=5.7M2024.02 | 77.8 | — | — | — | — | — | — | — | |
| OCRNetBackbone=HRNetV2p-W18, Resolution=1024x5122020.08 | 77.7 | — | — | — | — | — | — | — | |
| Fully SupervisedAnnotation Type=Points2026.03 | 77.6 | — | — | — | — | — | — | — | |
| Fully SupervisedAnnotation Type=Scribbles2026.03 | 77.6 | — | — | — | — | — | — | — | |
| Fully SupervisedAnnotation Type=Coarse2026.03 | 77.6 | — | — | — | — | — | — | — | |
| SLADStudent=ViT-B, Teacher=ViT-L2026.05 | 77.35 | — | — | — | — | — | — | — | |
| VWFormer-B0Params (M)=3.7, GFLOPS=112.4, FPS=21.1, Resolution=2048 x 1024, GPU=NVIDIA L40S, Batch size=22024.12 | 77.2 | — | — | — | — | — | — | — | |
| ConvNeXt-SBackbone=ConvNeXt-S, #Param. (M)=70M2026.03 | 77.12 | — | — | — | — | — | — | — | |
| OCRNetBackbone=HRNetV2p-W18small, Resolution=1024x5122020.08 | 77.1 | — | — | — | — | — | — | — | |
| LoRAStudent=ViT-B, Teacher=ViT-L2026.05 | 77.06 | — | — | — | — | — | — | — | |
| SwAVArchitecture=DeepLab-v32021.10 | 77 | — | — | — | — | — | — | — | |
| SetSimArchitecture=FCN (R50), Evaluation Protocol=Fine-tuning, Pre-training Epochs=2002021.07 | 77 | — | — | — | — | — | — | — | |
| DenseSiamPre-train=200-epoch IN1k, Model=FCN2022.03 | 77 | — | — | — | — | — | — | — | |
| STDC2-Seg75Backbone=STDC2, FPS=58.2, Resolution=1536x7682024.02 | 77 | — | — | — | — | — | — | — | |
| Single datasetBackbone=HRNet-W48, Label space=DS2024.07 | 77 | — | — | — | — | — | — | — |