Semantic Segmentation on CityScapes, BDD, and Mapillary (val)
70.79Mean mIoUSoMA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SoMABackbone=DINOv2-L, Head=M2F, Training Source=GTAV + SYNTHIA, Config=Variant 22024.12 | 70.79 | 74.85 | 63.59 | 73.92 | |
| SoMABackbone=DINOv2-L, Head=M2F, Training Source=GTAV, Config=Variant 22024.12 | 69.31 | 73.63 | 63.33 | 70.98 | |
| SoMABackbone=DINOv2-L, Head=M2F, Training Source=GTAV + SYNTHIA, Config=Variant 12024.12 | 69.26 | 73.16 | 61.9 | 72.73 | |
| SoMABackbone=DINOv2-L, Head=M2F, Training Source=GTAV, Config=Variant 12024.12 | 68.27 | 71.82 | 61.31 | 71.67 | |
| Rein†Backbone=DINOv2-L, Head=M2F, Training Source=GTAV + SYNTHIA2024.12 | 68.13 | 72.17 | 61.53 | 70.69 | |
| Rein†Backbone=DINOv2-L, Head=M2F, Training Source=GTAV, Config=Variant 22024.12 | 67.6 | 70.68 | 62.51 | 69.61 | |
| SoMABackbone=EVA02-L, Head=M2F, Training Source=GTAV, Config=Variant 22024.12 | 66.92 | 69.94 | 62.48 | 68.33 | |
| LORABackbone=DINOv2-L, Head=M2F, Training Source=GTAV2024.12 | 66.89 | 70.13 | 60.13 | 70.42 | |
| SSFBackbone=DINOv2-L, Head=M2F, Training Source=GTAV2024.12 | 66.35 | 68.97 | 61.3 | 68.77 | |
| AdaptFormerBackbone=DINOv2-L, Head=M2F, Training Source=GTAV2024.12 | 66.23 | 70.1 | 59.81 | 68.77 | |
| FADABackbone=DINOv2-L, Head=M2F, Training Source=GTAV2024.12 | 66.09 | 68.23 | 61.94 | 68.09 | |
| Rein†Backbone=DINOv2-L, Head=M2F, Training Source=GTAV, Config=Variant 12024.12 | 66.09 | 69.19 | 60.01 | 69.06 | |
| tqdmBackbone=EVA02-L, Head=M2F, Training Source=GTAV2024.12 | 66.05 | 68.88 | 59.18 | 70.1 | |
| SETBackbone=DINOv2-L, Head=M2F, Training Source=GTAV2024.12 | 65.79 | 68.06 | 61.64 | 67.68 | |
| SoMABackbone=EVA02-L, Head=M2F, Training Source=GTAV, Config=Variant 12024.12 | 65.73 | 68.05 | 60.81 | 68.33 | |
| VPTBackbone=DINOv2-L, Head=M2F, Training Source=GTAV2024.12 | 65.24 | 68.75 | 58.64 | 68.32 | |
| FADABackbone=EVA02-L, Head=M2F, Training Source=GTAV2024.12 | 64.9 | 66.7 | 61.9 | 66.1 | |
| DORABackbone=DINOv2-L, Head=M2F, Training Source=GTAV2024.12 | 64.17 | 66.12 | 59.31 | 67.07 | |
| Rein†Backbone=EVA02-L, Head=M2F, Training Source=GTAV2024.12 | 63.6 | 65.3 | 60.5 | 64.9 | |
| VLTSegBackbone=EVA02-L, Head=M2F, Training Source=GTAV2024.12 | 63.2 | 65.3 | 58.3 | 66 | |
| VLTSegTraining Dataset=UrbanSyn2023.12 | 61.8 | 70.1 | 52.4 | 63 | |
| CLOUDSBackbone=CLIP CN-L, Head=M2F, Training Source=GTAV2024.12 | 61.5 | 60.2 | 57.4 | 67 | |
| DIDEXEncoder=Transformer, No real data usage=true, UDA component=MIC [17]2023.12 | 59.7 | — | — | — | |
| DIDEXBackbone=MiT-B5, Head=DAFormer, Training Source=GTAV2024.12 | 59.7 | 62 | 54.3 | 63 | |
| DGInStyleBackbone=MiT-B5, Head=HRDA, Training Source=GTAV2024.12 | 57.78 | 58.63 | 52.25 | 62.47 | |
| SoMABackbone=Swin-L, Head=M2F, Training Source=GTAV2024.12 | 56.54 | 56.91 | 51.98 | 60.73 | |
| HRDAEncoder=Transformer, No real data usage=true2023.12 | 55.9 | — | — | — | |
| DIDEXTraining Dataset=SYNTHIA2023.12 | 55.6 | 59.8 | 47.4 | 59.5 | |
| CMFormerEncoder=Transformer, No real data usage=true2023.12 | 55.1 | — | — | — | |
| CMFormerBackbone=Swin-L, Training Source=GTAV2024.12 | 55.1 | 55.31 | 49.91 | 60.09 | |
| VLTSegTraining Dataset=SYNTHIA2023.12 | 54.6 | 56.8 | 51.9 | 55.1 | |
| BaselineTraining Dataset=UrbanSyn2023.12 | 54.5 | 63.3 | 41.3 | 58.8 | |
| CLOUDSTraining Dataset=SYNTHIA2023.12 | 52.1 | 53.4 | 47 | 55.8 | |
| DAFormerEncoder=Transformer, No real data usage=true2023.12 | 51.7 | — | — | — | |
| ReVTEncoder=Transformer, No real data usage=true2023.12 | 50.3 | — | — | — | |
| FAMixBackbone=CLIP RN101, Head=DL-V3+, Training Source=GTAV2024.12 | 49.28 | 49.47 | 46.4 | 51.97 | |
| FAMixBackbone=CLIP RN50, Head=DL-V3+, Training Source=GTAV + SYNTHIA2024.12 | 48.84 | 49.41 | 45.51 | 51.61 | |
| IBAFormerTraining Dataset=SYNTHIA2023.12 | 48.7 | 50.9 | 44.7 | 50.6 | |
| DIDEXEncoder=ResNet, No real data usage=true, UDA component=MIC [17]2023.12 | 47.5 | — | — | — | |
| BaselineEncoder=Transformer, No real data usage=true2023.12 | 47.4 | — | — | — | |
| TLDRBackbone=RN101, Head=DL-V3+, Training Source=GTAV2024.12 | 47.09 | 47.58 | 44.88 | 48.8 | |
| MoDifyBackbone=RN101, Head=DL-V2, Training Source=GTAV2024.12 | 46.8 | 48.8 | 44.2 | 47.5 | |
| SPCBackbone=RN101, Head=DL-V3+, Training Source=GTAV + SYNTHIA2024.12 | 46.78 | 47.93 | 43.62 | 48.79 | |
| RICAEncoder=ResNet, No real data usage=true2023.12 | 46.5 | — | — | — | |
| TLDRBackbone=RN50, Head=DL-V3+, Training Source=GTAV + SYNTHIA2024.12 | 46.4 | 48.83 | 42.58 | 47.8 | |
| SoMABackbone=RN101, Head=M2F, Training Source=GTAV2024.12 | 45.5 | 41.23 | 45.57 | 49.71 | |
| PASTABackbone=RN101, Head=DL-V3+, Training Source=GTAV2024.12 | 45.42 | 45.33 | 42.32 | 48.6 | |
| SHADEEncoder=ResNet, No real data usage=true2023.12 | 45.3 | — | — | — | |
| SHADEBackbone=RN101, Head=DL-V3+, Training Source=GTAV2024.12 | 45.27 | 46.66 | 43.66 | 45.5 | |
| SHADEBackbone=RN50, Head=DL-V3+, Training Source=GTAV + SYNTHIA2024.12 | 45.11 | 47.43 | 40.3 | 47.6 | |
| WildNetEncoder=ResNet, No real data usage=false2023.12 | 44.9 | — | — | — | |
| WildNetBackbone=RN101, Head=DL-V3+, Training Source=GTAV2024.12 | 44.87 | 45.79 | 41.73 | 47.08 | |
| WEDGEEncoder=ResNet, No real data usage=false2023.12 | 44.8 | — | — | — | |
| BlindNetBackbone=RN50, Head=DL-V3+, Training Source=GTAV2024.12 | 44.71 | 45.72 | 41.32 | 47.08 | |
| MRFP+Backbone=RN50, Head=DL-V3+, Training Source=GTAV + SYNTHIA2024.12 | 44.24 | 46.18 | 41.13 | 45.28 | |
| ReVTTraining Dataset=SYNTHIA2023.12 | 43.8 | 46.3 | 40.3 | 44.8 | |
| SPCBackbone=RN50, Head=DL-V3+, Training Source=GTAV2024.12 | 43.36 | 44.1 | 40.46 | 45.51 | |
| FSDREncoder=ResNet, No real data usage=false2023.12 | 43.1 | — | — | — | |
| SAN-SAWBackbone=RN101, Head=DL-V3+, Training Source=GTAV2024.12 | 42.43 | 45.33 | 41.18 | 40.77 | |
| SAN+SAWEncoder=ResNet, No real data usage=true2023.12 | 42.4 | — | — | — | |
| MRFP+Backbone=RN50, Head=DL-V3+, Training Source=GTAV2024.12 | 42.29 | 42.4 | 39.55 | 44.93 | |
| PintheMemBackbone=RN101, Head=DL-V2, Training Source=GTAV2024.12 | 41.97 | 44.9 | 39.71 | 41.31 | |
| AdvStyleBackbone=RN101, Head=DL-V3+, Training Source=GTAV2024.12 | 41.91 | 43.44 | 40.32 | 41.96 | |
| PintheMemBackbone=RN50, Head=DL-V3+, Training Source=GTAV + SYNTHIA2024.12 | 41.76 | 44.51 | 38.07 | 42.7 | |
| DIGABackbone=RN101, Head=DL-V2, Training Source=GTAV + SYNTHIA2024.12 | 41.27 | 46.43 | 33.87 | 43.51 | |
| GTREncoder=ResNet, No real data usage=false2023.12 | 40.8 | — | — | — | |
| GTRBackbone=RN101, Training Source=GTAV2024.12 | 40.8 | 43.7 | 39.6 | 39.1 | |
| DIRLBackbone=RN50, Head=DL-V3+, Training Source=GTAV2024.12 | 40.6 | 41.04 | 39.15 | 41.6 | |
| CMFormerTraining Dataset=SYNTHIA2023.12 | 40.4 | 44.6 | 33.4 | 43.3 | |
| SiamDoGeBackbone=RN50, Head=DL-V3+, Training Source=GTAV2024.12 | 40.38 | 42.96 | 37.54 | 40.64 | |
| BaselineTraining Dataset=SYNTHIA2023.12 | 40 | 41.4 | 36.2 | 42.4 | |
| ISW+AdvStyleBackbone=ResNet-50, Source Domains=GTAV+SYNTHIA2022.07 | 39.9 | 39.29 | 39.26 | 41.14 | |
| AdvStyleBackbone=RN50, Head=DL-V3+, Training Source=GTAV + SYNTHIA2024.12 | 39.9 | 39.29 | 39.26 | 41.14 | |
| DRPCEncoder=ResNet, No real data usage=false2023.12 | 39.8 | — | — | — | |
| DRPCBackbone=RN101, Head=FCN, Training Source=GTAV2024.12 | 39.77 | 42.53 | 38.72 | 38.05 | |
| BaselineEncoder=ResNet, No real data usage=true2023.12 | 38.8 | — | — | — | |
| RobustNetEncoder=ResNet, No real data usage=true2023.12 | 38 | — | — | — | |
| RobustNetBackbone=RN50, Head=DL-V3+, Training Source=GTAV2024.12 | 37.37 | 36.58 | 35.2 | 40.33 | |
| IBN-NetEncoder=ResNet, No real data usage=true2023.12 | 37.1 | — | — | — | |
| RobustNetBackbone=RN50, Head=DL-V3+, Training Source=GTAV + SYNTHIA2024.12 | 36.76 | 37.69 | 34.09 | 38.49 | |
| ISWBackbone=ResNet-50, Source Domains=GTAV+SYNTHIA2022.07 | 36.75 | 37.69 | 34.09 | 38.49 | |
| IBN-NetBackbone=ResNet-50, Source Domains=GTAV+SYNTHIA2022.07 | 35.27 | 35.55 | 32.18 | 38.09 | |
| SWEncoder=ResNet, No real data usage=true2023.12 | 35.1 | — | — | — | |
| IBN-NetBackbone=RN50, Head=DL-V3+, Training Source=GTAV2024.12 | 34.63 | 33.85 | 32.3 | 37.75 | |
| BaselineBackbone=ResNet-50, Source Domains=GTAV+SYNTHIA2022.07 | 30.83 | 35.46 | 25.09 | 31.94 | |
| PromptFormerTraining Dataset=SYNTHIA2023.12 | — | 49.3 | — | — |