Semantic Segmentation on BDD100K
93.4mIoUUV-M3TL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UV-M3TL2026.02 | 93.4 | — | |
| YOLOPv22026.02 | 93.2 | — | |
| YOLOPX2026.02 | 93.2 | — | |
| YOLOP2026.02 | 91.5 | — | |
| HybridNets2026.02 | 90.5 | — | |
| PSPNet2026.02 | 89.6 | — | |
| MultiNet2026.02 | 71.6 | — | |
| DLT-Net2026.02 | 71.3 | — | |
| Multi-SegHeadBackbone=HRNet-W48, Label space=DS2024.07 | 65.6 | — | |
| AutoUniSeg (Ours)Backbone=HRNet-W48, Label space=Auto2024.07 | 65.5 | — | |
| Open-TransMindBackbone=vit-huge, Type=multi, Tasks=cls, det, seg2023.04 | 64.8 | — | |
| MSegBackbone=HRNet-W48, Venue=CVPR 20, Label space=MR2024.07 | 63.5 | — | |
| Open-TransMindBackbone=vit-huge, Type=single, Tasks=seg2023.04 | 63.41 | — | |
| CMFormerBackbone=Swin-L, Trained on Cityscapes=true2023.07 | 62.6 | — | |
| Single datasetBackbone=HRNet-W48, Label space=DS2024.07 | 62.4 | — | |
| LoCA‡Backbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=5.0M, GFLOPs=152, Pre-trained=DINO2026.07 | 62.03 | — | |
| LoCABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=5.0M, GFLOPs=152, Pre-trained=DINO2026.07 | 61.6 | — | |
| HGFormerBackbone=Swin-L, Trained on Cityscapes=true2023.07 | 61.5 | — | |
| GiT-HModel Size=Huge, Training Protocol=universal2024.03 | 61.5 | — | |
| LoRABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=25.9M, GFLOPs=152, Pre-trained=DINO2026.07 | 60.5 | — | |
| LoRA (Linear)Backbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=4.3M, GFLOPs=152, Pre-trained=DINO2026.07 | 60.46 | — | |
| Uni NLL+Backbone=SNp-DN161, Venue=IJCV 24, Label space=MC2024.07 | 60.4 | — | |
| SoMABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=4.3M, GFLOPs=152, Pre-trained=DINO2026.07 | 60.27 | — | |
| Mask2FormerBackbone=Swin-L, Trained on Cityscapes=true2023.07 | 60.1 | — | |
| Auto univ.Backbone=SNp-RN18, Venue=BMVC 22, Label space=Auto2024.07 | 59.6 | — | |
| CoLoRABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=3.6M, GFLOPs=152, Pre-trained=DINO2026.07 | 59.56 | — | |
| GiT-LModel Size=Large, Training Protocol=universal2024.03 | 59.3 | — | |
| CMFormerBackbone=Swin-B, Trained on Cityscapes=true2023.07 | 59.27 | — | |
| FFTBackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=196.2M, GFLOPs=152, Pre-trained=DINO2026.07 | 59.1 | — | |
| OraclesBackbone=SED [71]2025.03 | 58.61 | — | |
| LoCABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=3.4M, GFLOPs=81, Pre-trained=DINO2026.07 | 58.53 | — | |
| FSFBackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=0.8M, GFLOPs=152, Pre-trained=DINO2026.07 | 58.52 | — | |
| NLL+Backbone=SNp-RN18, Venue=WACV 22, Label space=MC2024.07 | 58.5 | — | |
| CABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=4.5M, GFLOPs=152, Pre-trained=DINO2026.07 | 58.41 | — | |
| LoCA‡Backbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=3.4M, GFLOPs=81, Pre-trained=DINO2026.07 | 58.02 | — | |
| LoRA (Linear)Backbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.9M, GFLOPs=81, Pre-trained=DINO2026.07 | 57.87 | — | |
| GiT-BModel Size=Base, Training Protocol=universal2024.03 | 57.8 | — | |
| SoMABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.9M, GFLOPs=81, Pre-trained=DINO2026.07 | 57.65 | — | |
| SoMABackbone=ViT-B, Param.=86.5M, Trainable Param.=2.3M, GFLOPs=216, Pre-trained=DINO2026.07 | 57.48 | — | |
| FFTBackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=87.56M, GFLOPs=81, Pre-trained=DINO2026.07 | 57.01 | — | |
| LoRABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=17.2M, GFLOPs=81, Pre-trained=DINO2026.07 | 56.98 | — | |
| FSFBackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=0.6M, GFLOPs=81, Pre-trained=DINO2026.07 | 56.98 | — | |
| Open-TransMindBackbone=vit-base, Type=task-moe, Tasks=cls, det, seg2023.04 | 56.81 | — | |
| CABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.3M, GFLOPs=81, Pre-trained=DINO2026.07 | 56.47 | — | |
| CoLoRABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.2M, GFLOPs=81, Pre-trained=DINO2026.07 | 55.7 | — | |
| Mask2FormerBackbone=Swin-B, Trained on Cityscapes=true2023.07 | 55.43 | — | |
| Open-TransMindBackbone=vit-base, Type=multi, Tasks=cls, det, seg2023.04 | 55.13 | — | |
| UniformBackbone=SED [71]2025.03 | 54.78 | — | |
| SemLABackbone=SED [71]2025.03 | 54.4 | — | |
| NiseNetBackbone=resnet101, Type=single, Tasks=seg2023.04 | 53.52 | — | |
| HGFormerBackbone=Swin-T, Trained on Cityscapes=true2023.07 | 53.4 | — | |
| FFTBackbone=ViT-B, Param.=86.5M, Trainable Param.=86.5M, GFLOPs=216, Pre-trained=DINO2026.07 | 52.98 | — | |
| SAWBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 52.95 | — | |
| Open-TransMindBackbone=vit-base, Type=single, Tasks=seg2023.04 | 52.55 | — | |
| DIRLBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 51.8 | — | |
| Mask2FormerBackbone=Swin-T, Trained on Cityscapes=true2023.07 | 51.3 | — | |
| SHADEBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 50.95 | — | |
| WildNetBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 50.94 | — | |
| GTRBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 50.75 | — | |
| ISWBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 50.73 | — | |
| LoCABackbone=MambaVision-L3, Param.=737.5M, Trainable Param.=9.0M, GFLOPs=1,556, Pre-trained=ImageNet21k2026.07 | 50.61 | — | |
| DRPCBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 49.86 | — | |
| IternormBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 49.23 | — | |
| IBNBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 48.56 | — | |
| IWBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 48.49 | — | |
| OpenSeeD (L)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 47.4 | — | |
| X-Decoder (L)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Large2023.03 | 47.2 | — | |
| LoCABackbone=ResNet101, Param.=42.3M, Trainable Param.=2.8M, GFLOPs=42, Pre-trained=ImageNet21k2026.07 | 46.13 | — | |
| FFTBackbone=MambaVision-L3, Param.=737.5M, Trainable Param.=737.5M, GFLOPs=1,556, Pre-trained=ImageNet21k2026.07 | 45.87 | — | |
| SoMA†Backbone=ResNet101, Param.=42.3M, Trainable Param.=2.5M, GFLOPs=42, Pre-trained=ImageNet21k2026.07 | 45.57 | — | |
| Pin the MemoryArchitecture=DeepLabV2, Backbone=ResNet101, w/Target=false, Source Domains=GTAV + Synthia2022.04 | 45.5 | — | |
| MSeg (B)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Base2023.03 | 44.9 | — | |
| OpenSeeD (T)Training Data (SEG)=true, Training Data (DET)=true, Training Data (ITP)=false, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 44.8 | — | |
| CoTICAScenario=TTA, Source dataset=GTA52025.12 | 44.5 | — | |
| FFTBackbone=ResNet101, Param.=42.3M, Trainable Param.=42.3M, GFLOPs=42, Pre-trained=ImageNet21k2026.07 | 44.29 | — | |
| Zero-shotBackbone=SED [71]2025.03 | 43.41 | — | |
| MADAN+Architecture=DeepLabV2, Backbone=ResNet101, w/Target=true, Source Domains=GTAV + Synthia2022.04 | 42.7 | — | |
| X-Decoder (T)Training Data (SEG)=true, Training Data (DET)=false, Training Data (ITP)=true, Evaluation Protocol=Zero-shot, Backbone=Tiny2023.03 | 42.4 | — | |
| DATScenario=TTA, Source dataset=GTA52025.12 | 41.8 | — | |
| LoCABackbone=MambaVision-B, Param.=96.7M, Trainable Param.=2.5M, GFLOPs=211, Pre-trained=ImageNet21k2026.07 | 41.68 | — | |
| TENTScenario=TTA, Source dataset=GTA52025.12 | 41.4 | — | |
| SourceScenario=TTA, Source dataset=GTA52025.12 | 41.2 | — | |
| CoTTAScenario=TTA, Source dataset=GTA52025.12 | 40.5 | — | |
| MADANArchitecture=DeepLabV2, Backbone=ResNet101, w/Target=true, Source Domains=GTAV + Synthia2022.04 | 40.4 | — | |
| BaselineArchitecture=DeepLabV2, Backbone=ResNet101, w/Target=false, Source Domains=GTAV + Synthia2022.04 | 37.4 | — | |
| CyCADAArchitecture=DeepLabV2, Backbone=ResNet101, w/Target=true, Source Domains=GTAV + Synthia2022.04 | 37.2 | — | |
| LFMEBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Re-evaluated2024.10 | 35.7 | 46.16 | |
| SAWTrained on=SYNTHIA (S)2023.07 | 35.24 | — | |
| PinMemBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Re-evaluated2024.10 | 34.94 | 44.11 | |
| RobustNetBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Cited from [19]2024.10 | 34.09 | — | |
| CMFormerTrained on=SYNTHIA (S)2023.07 | 33.44 | — | |
| IBN-NetBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Cited from [19]2024.10 | 32.18 | — | |
| GTRTrained on=SYNTHIA (S)2023.07 | 32.02 | — | |
| ISWTrained on=SYNTHIA (S)2023.07 | 31.62 | — | |
| DRPCTrained on=SYNTHIA (S)2023.07 | 31.53 | — | |
| IBNTrained on=SYNTHIA (S)2023.07 | 30.57 | — | |
| FFTBackbone=MambaVision-B, Param.=96.7M, Trainable Param.=96.7M, GFLOPs=211, Pre-trained=ImageNet21k2026.07 | 30.13 | — | |
| MDANArchitecture=DeepLabV2, Backbone=ResNet101, w/Target=true, Source Domains=GTAV + Synthia2022.04 | 29.4 | — | |
| SDBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Re-evaluated2024.10 | 28 | 40.33 | |
| BaselineBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Re-evaluated2024.10 | 27.95 | 39.04 |