Semantic Segmentation on Mapillary
77.87mIoUSoMA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SoMABackbone=DINOv2-L, Trainable Parameters=4.9M, Multi-scale flip augmentation=true2024.12 | 77.87 | — | |
| SoMABackbone=DINOv2-L, Trainable Parameters=4.9M, Multi-scale flip augmentation=false2024.12 | 76.45 | — | |
| tqdmBackbone=EVA02-L, Trainable Parameters=304.2M2024.12 | 76.15 | — | |
| FADABackbone=DINOv2-L, Trainable Parameters=111.7M2024.12 | 75.86 | — | |
| ReinBackbone=DINOv2-L, Trainable Parameters=3.0M, Re-implemented=true2024.12 | 75.18 | — | |
| CMFormerBackbone=Swin-L, Trained on Cityscapes=true2023.07 | 73.6 | — | |
| CMFormerBackbone=Swin-L, Trainable Parameters=196.0M2024.12 | 73.6 | — | |
| Mask2FormerBackbone=Swin-L, Trained on Cityscapes=true2023.07 | 72.2 | — | |
| HGFormerBackbone=Swin-L, Trained on Cityscapes=true2023.07 | 72.1 | — | |
| HGFormerBackbone=Swin-L, Trainable Parameters=196.0M2024.12 | 72.1 | — | |
| CMFormerBackbone=Swin-B, Trained on Cityscapes=true2023.07 | 71.1 | — | |
| LoCA‡Backbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=5.0M, GFLOPs=152, Pre-trained=DINO2026.07 | 70.62 | — | |
| BaselineBackbone=ResNet-502022.04 | 70.49 | — | |
| LoCABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=5.0M, GFLOPs=152, Pre-trained=DINO2026.07 | 69.33 | — | |
| SoMABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=4.3M, GFLOPs=152, Pre-trained=DINO2026.07 | 69.26 | — | |
| LoRABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=25.9M, GFLOPs=152, Pre-trained=DINO2026.07 | 68.62 | — | |
| LoRA (Linear)Backbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=4.3M, GFLOPs=152, Pre-trained=DINO2026.07 | 68.45 | — | |
| SoMABackbone=ViT-B, Param.=86.5M, Trainable Param.=2.3M, GFLOPs=216, Pre-trained=DINO2026.07 | 67.34 | — | |
| CABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=4.5M, GFLOPs=152, Pre-trained=DINO2026.07 | 67.32 | — | |
| CoLoRABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=3.6M, GFLOPs=152, Pre-trained=DINO2026.07 | 67.2 | — | |
| FFTBackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=196.2M, GFLOPs=152, Pre-trained=DINO2026.07 | 67.01 | — | |
| FSFBackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=0.8M, GFLOPs=152, Pre-trained=DINO2026.07 | 66.96 | — | |
| HGFormerBackbone=Swin-T, Trained on Cityscapes=true2023.07 | 66.9 | — | |
| LoCA‡Backbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=3.4M, GFLOPs=81, Pre-trained=DINO2026.07 | 66.39 | — | |
| LoCABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=3.4M, GFLOPs=81, Pre-trained=DINO2026.07 | 66.29 | — | |
| Mask2FormerBackbone=Swin-B, Trained on Cityscapes=true2023.07 | 66.12 | — | |
| LoRABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=17.2M, GFLOPs=81, Pre-trained=DINO2026.07 | 65.74 | — | |
| SoMABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.9M, GFLOPs=81, Pre-trained=DINO2026.07 | 65.67 | — | |
| LoRA (Linear)Backbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.9M, GFLOPs=81, Pre-trained=DINO2026.07 | 65.53 | — | |
| Mask2FormerBackbone=Swin-T, Trained on Cityscapes=true2023.07 | 65.3 | — | |
| FFTBackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=87.56M, GFLOPs=81, Pre-trained=DINO2026.07 | 65 | — | |
| CoLoRABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.2M, GFLOPs=81, Pre-trained=DINO2026.07 | 64.04 | — | |
| FSFBackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=0.6M, GFLOPs=81, Pre-trained=DINO2026.07 | 63.7 | — | |
| CABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.3M, GFLOPs=81, Pre-trained=DINO2026.07 | 63.48 | — | |
| FFTBackbone=ViT-B, Param.=86.5M, Trainable Param.=86.5M, GFLOPs=216, Pre-trained=DINO2026.07 | 62.12 | — | |
| LoCABackbone=MambaVision-L3, Param.=737.5M, Trainable Param.=9.0M, GFLOPs=1,556, Pre-trained=ImageNet21k2026.07 | 61.39 | — | |
| SHADEBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 60.67 | — | |
| CMFormerSource Dataset=GTA52023.07 | 60.09 | — | |
| SAWBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 59.81 | — | |
| WildNetBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 58.79 | — | |
| ISWBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 58.64 | — | |
| CoCoOp+CAKIBase Model=SEEM-Large2026.05 | 57.5 | — | |
| GTRBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 57.16 | — | |
| IBNBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 57.04 | — | |
| DRPCBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 56.34 | — | |
| IternormBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 56.26 | — | |
| CoCoOpBase Model=SEEM-Large2026.05 | 56.2 | — | |
| FFTBackbone=MambaVision-L3, Param.=737.5M, Trainable Param.=737.5M, GFLOPs=1,556, Pre-trained=ImageNet21k2026.07 | 56.07 | — | |
| IWBackbone=ResNet50, Trained on Cityscapes=true2023.07 | 55.82 | — | |
| Pin the MemorySegmentation model=DeepLabV3, Backbone=ResNet-50, Source Domain=Cityscapes2022.04 | 55.1 | — | |
| CoOp+CAKIBase Model=SEEM-Large2026.05 | 53.4 | — | |
| CoOpBase Model=SEEM-Large2026.05 | 52 | — | |
| MSegBackbone=HRNet-W48, Venue=CVPR 20, Label space=MR2024.07 | 51.9 | — | |
| CCLSource=Cityscapes, Target Adaptation Setup=IDD + Mapillary, Backbone=ResNet-1012021.06 | 51.4 | — | |
| MCIBISegmentation model=DeepLabV3, Backbone=ResNet-50, Source Domain=Cityscapes2022.04 | 50.18 | — | |
| CCLSource=IDD, Target Adaptation Setup=Cityscapes + Mapillary, Backbone=ResNet-1012021.06 | 49.8 | — | |
| SoMA†Backbone=ResNet101, Param.=42.3M, Trainable Param.=2.5M, GFLOPs=42, Pre-trained=ImageNet21k2026.07 | 49.71 | — | |
| CCLSource=Cityscapes, Target Adaptation Setup=Mapillary, Backbone=ResNet-1012021.06 | 49.6 | — | |
| LoCABackbone=ResNet101, Param.=42.3M, Trainable Param.=2.8M, GFLOPs=42, Pre-trained=ImageNet21k2026.07 | 49.21 | — | |
| CCLSource=IDD, Target Adaptation Setup=Mapillary, Backbone=ResNet-1012021.06 | 49 | — | |
| FFTBackbone=ResNet101, Param.=42.3M, Trainable Param.=42.3M, GFLOPs=42, Pre-trained=ImageNet21k2026.07 | 48.79 | — | |
| SEEM-Large2026.05 | 47.9 | — | |
| WildNetSource Dataset=GTA5, Backbone=ResNet-502023.07 | 46.09 | — | |
| LoCABackbone=MambaVision-B, Param.=96.7M, Trainable Param.=2.5M, GFLOPs=211, Pre-trained=ImageNet21k2026.07 | 45.7 | — | |
| SPCSource Dataset=GTA5, Backbone=ResNet-502023.07 | 45.51 | — | |
| CoCoOp+CAKIBase Model=SEEM-Tiny2026.05 | 44.9 | — | |
| CoCoOpBase Model=SEEM-Tiny2026.05 | 44.5 | — | |
| Uni NLL+Backbone=SNp-DN161, Venue=IJCV 24, Label space=MC2024.07 | 44.2 | — | |
| CoOp+CAKIBase Model=SEEM-Tiny2026.05 | 43.8 | — | |
| AutoUniSeg (Ours)Backbone=HRNet-W48, Label space=Auto2024.07 | 43.7 | — | |
| SHADESource Dataset=GTA5, Backbone=ResNet-502023.07 | 43.34 | — | |
| CoOpBase Model=SEEM-Tiny2026.05 | 43.3 | — | |
| SEEM-Tiny2026.05 | 42.1 | — | |
| SAWSource Dataset=GTA5, Backbone=ResNet-502023.07 | 41.86 | — | |
| DIRLSource Dataset=GTA5, Backbone=ResNet-502023.07 | 41.6 | — | |
| LFMEBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Re-evaluated2024.10 | 41.04 | 53.71 | |
| ISWSource Dataset=GTA5, Backbone=ResNet-502023.07 | 40.33 | — | |
| PinMemBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Re-evaluated2024.10 | 39.41 | 49.87 | |
| NLL+Backbone=SNp-RN18, Venue=WACV 22, Label space=MC2024.07 | 39.1 | — | |
| RobustNetBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Cited from [19]2024.10 | 38.49 | — | |
| IBN-NetBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Cited from [19]2024.10 | 38.09 | — | |
| IBNSource Dataset=GTA5, Backbone=ResNet-502023.07 | 37.75 | — | |
| AdvStyleSource Dataset=GTA5, Backbone=ResNet-502023.07 | 37 | — | |
| Multi-SegHeadBackbone=HRNet-W48, Label space=DS2024.07 | 36.1 | — | |
| Auto univ.Backbone=SNp-RN18, Venue=BMVC 22, Label space=Auto2024.07 | 35.8 | — | |
| GTRSource Dataset=GTA5, Backbone=ResNet-502023.07 | 34.52 | — | |
| DRPCSource Dataset=GTA5, Backbone=ResNet-502023.07 | 34.12 | — | |
| IternormSource Dataset=GTA5, Backbone=ResNet-502023.07 | 33.88 | — | |
| BaselineBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Re-evaluated2024.10 | 32.01 | 48.88 | |
| BaselineBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Cited from [19]2024.10 | 31.94 | — | |
| SDBackbone=ResNet-50, Source Datasets=GTAV + Synthia, Implementation Source=Re-evaluated2024.10 | 31.41 | 48.18 | |
| FFTBackbone=MambaVision-B, Param.=96.7M, Trainable Param.=96.7M, GFLOPs=211, Pre-trained=ImageNet21k2026.07 | 31.39 | — | |
| Single datasetBackbone=HRNet-W48, Label space=DS2024.07 | 30.2 | — | |
| IWSource Dataset=GTA5, Backbone=ResNet-502023.07 | 29.71 | — | |
| TPT + HisTPTModel Scale=Large2024.10 | 21.3 | — | |
| DiffTPT + HisTPTModel Scale=Large2024.10 | 21.1 | — | |
| HisTPTModel Scale=Large2024.10 | 20.1 | — | |
| DiffTPTModel Scale=Large2024.10 | 19.3 | — | |
| TPTModel Scale=Large2024.10 | 19.1 | — | |
| SEEMModel Scale=Large2024.10 | 18.7 | — |