Semantic Segmentation on GTA5 to {Cityscapes, Mapillary, BDD} (test)
73.63mIoU (Cityscapes)SoMA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SoMABackbone=DINOv2-L, Params.=4.9M2024.12 | 73.63 | 70.98 | 63.33 | 69.31 | — | |
| SoMABackbone=DINOv2-L, Params.=4.9M2024.12 | 71.82 | 71.67 | 61.31 | 68.27 | — | |
| Rein†Backbone=DINOv2-L, Params.=3.0M2024.12 | 70.68 | 69.61 | 62.51 | 67.6 | — | |
| LoRABackbone=DINOv2-L, Params.=7.3M2024.12 | 70.13 | 70.42 | 60.13 | 66.89 | — | |
| AdaptFormerBackbone=DINOv2-L, Params.=6.3M2024.12 | 70.1 | 68.77 | 59.81 | 66.23 | — | |
| SoMABackbone=EVA02-L, Params.=5.1M2024.12 | 69.94 | 68.33 | 62.48 | 66.92 | — | |
| SSFBackbone=DINOv2-L, Params.=0.5M2024.12 | 68.97 | 68.77 | 61.3 | 66.35 | — | |
| tqdmTask=DGSS, Backbone=EVA02-L2024.07 | 68.88 | 70.1 | 59.18 | 66.05 | — | |
| tqdmBackbone=EVA02-L, Params.=304.2M2024.12 | 68.88 | 70.1 | 59.18 | 66.05 | — | |
| VPTBackbone=DINOv2-L, Params.=3.7M2024.12 | 68.75 | 68.32 | 58.64 | 65.24 | — | |
| FADABackbone=DINOv2-L, Params.=11.7M2024.12 | 68.23 | 68.09 | 61.94 | 66.09 | — | |
| SETBackbone=DINOv2-L, Params.=6.1M2024.12 | 68.06 | 67.68 | 61.64 | 65.79 | — | |
| SoMABackbone=EVA02-L, Params.=5.1M2024.12 | 68.05 | 68.33 | 60.81 | 65.73 | — | |
| FADABackbone=EVA02-L, Params.=11.7M2024.12 | 66.7 | 66.1 | 61.9 | 64.9 | — | |
| ReinBackbone=DINOv2 (Large), Fine-tune Method=Rein, Trainable Params=2.99M2023.12 | 66.4 | 66.1 | 60.4 | 64.3 | — | |
| DORABackbone=DINOv2-L, Params.=7.5M2024.12 | 66.12 | 67.07 | 59.31 | 64.17 | — | |
| ReinBackbone=EVA02 (Large), Fine-tune Method=Rein, Trainable Params=2.99M2023.12 | 65.3 | 64.9 | 60.5 | 63.6 | — | |
| VLTSegBackbone=EVA02-L, Params.=304.2M2024.12 | 65.3 | 66 | 58.3 | 63.2 | — | |
| ReinBackbone=EVA02-L, Params.=3.0M2024.12 | 65.3 | 64.9 | 60.5 | 63.6 | — | |
| DINOv2Backbone=DINOv2 (Large), Fine-tune Method=Full, Trainable Params=304.20M2023.12 | 63.7 | 64.2 | 57.4 | 61.7 | — | |
| DINOv2-LPublication=arXiv23, Model Category=Frozen backbone of VFMs, Backbone=ViT-L, Decoder Head=Mask2Former2023.12 | 63.3 | 63.9 | 56.1 | 61.1 | — | |
| DINOv2Backbone=DINOv2 (Large), Fine-tune Method=Freeze, Trainable Params=0.00M2023.12 | 63.3 | 63.9 | 56.1 | 61.1 | — | |
| EVA02Backbone=EVA02 (Large), Fine-tune Method=Full, Trainable Params=304.24M2023.12 | 62.1 | 64.6 | 56.2 | 60.9 | — | |
| CLOUDSBackbone=CLIP-CN-L, Params.=0.0M2024.12 | 60.2 | 67 | 57.4 | 61.5 | — | |
| ReinBackbone=SAM (Huge), Fine-tune Method=Rein, Trainable Params=4.51M2023.12 | 59.6 | 62.1 | 52 | 57.9 | — | |
| SAMBackbone=SAM (Huge), Fine-tune Method=Full, Trainable Params=632.18M2023.12 | 57.6 | 61.5 | 51.7 | 56.9 | — | |
| CAT-SegTask=OVS, Backbone=EVA02-L + Swin-B2024.07 | 57.3 | 61.83 | 51.24 | 56.79 | — | |
| ReinBackbone=CLIP (ViT-Large), Fine-tune Method=Rein, Trainable Params=2.99M2023.12 | 57.1 | 60.5 | 54.7 | 57.4 | — | |
| SAM-HPublication=ICCV23, Model Category=Frozen backbone of VFMs, Backbone=ViT-H, Decoder Head=Mask2Former2023.12 | 57 | 58.4 | 47.1 | 54.2 | — | |
| SAMBackbone=SAM (Huge), Fine-tune Method=Freeze, Trainable Params=0.00M2023.12 | 57 | 58.4 | 47.1 | 54.2 | — | |
| EVA02-LPublication=arXiv23, Model Category=Frozen backbone of VFMs, Backbone=ViT-L, Decoder Head=Mask2Former2023.12 | 56.5 | 58.6 | 53.6 | 56.2 | — | |
| EVA02Backbone=EVA02 (Large), Fine-tune Method=Freeze, Trainable Params=0.00M2023.12 | 56.5 | 58.6 | 53.6 | 56.2 | — | |
| ReinBackbone=MAE (Large), Fine-tune Method=Rein, Trainable Params=2.99M2023.12 | 55 | 58.6 | 49.3 | 54.3 | — | |
| CLIP-ViT-LPublication=ICML21, Model Category=Frozen backbone of VFMs, Backbone=ViT-L, Decoder Head=Mask2Former2023.12 | 53.7 | 55 | 48.7 | 52.4 | — | |
| CLIPBackbone=CLIP (ViT-Large), Fine-tune Method=Freeze, Trainable Params=0.00M2023.12 | 53.7 | 55 | 48.7 | 52.4 | — | |
| MAEBackbone=MAE (Large), Fine-tune Method=Full, Trainable Params=330.94M2023.12 | 53.7 | 58.1 | 50.8 | 54.2 | — | |
| CLIPBackbone=CLIP (ViT-Large), Fine-tune Method=Full, Trainable Params=304.15M2023.12 | 51.3 | 54.3 | 47.6 | 51.1 | — | |
| TLDRPublication=ICCV23, Model Category=Previous DGSS methods, Decoder Head=Mask2Former2023.12 | 47.6 | 48.8 | 44.9 | 47.1 | — | |
| SPCPublication=CVPR23, Model Category=Previous DGSS methods, Decoder Head=Mask2Former2023.12 | 46.7 | 45.5 | 43.7 | 45.3 | — | |
| WildNetPublication=CVPR22, Model Category=Previous DGSS methods, Decoder Head=Mask2Former2023.12 | 45.8 | 47.1 | 41.7 | 44.9 | — | |
| ISW+AdvStyleBackbone=ResNet-101, Training Set=Training set (12,403), Evaluation Checkpoint=Best, Auxiliary ImageNet Data=false2022.07 | 45.62 | 46.69 | 41.71 | 44.67 | 13.2 | |
| PASTAPublication=ICCV23, Model Category=Previous DGSS methods, Decoder Head=Mask2Former2023.12 | 45.3 | 48.6 | 42.3 | 45.4 | — | |
| IDABackbone=ResNet-101, Access to target-domain data=true2021.03 | 45.1 | 39.4 | 37.6 | 40.7 | — | |
| FDABackbone=ResNet-101, Access to target-domain data=true2021.03 | 45 | 39.6 | 38.1 | 40.9 | — | |
| CBSTBackbone=ResNet-101, Access to target-domain data=true2021.03 | 44.9 | 40.3 | 40.5 | 41.9 | — | |
| FSDRBackbone=ResNet-101, Access to target-domain data=false2021.03 | 44.8 | 43.4 | 41.2 | 43.1 | — | |
| FSDRBackbone=ResNet-101, Training Set=Whole set (24,966), Evaluation Checkpoint=Best, Auxiliary ImageNet Data=true2022.07 | 44.8 | 43.4 | 41.2 | 43.13 | 13.6 | |
| ISW+AdvStyleBackbone=ResNet-101, Training Set=Whole set (24,966), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 44.51 | 43.48 | 39.27 | 42.42 | — | |
| IBN-Net+AdvStyleBackbone=ResNet-101, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 44.04 | 42.67 | 39.96 | 42.22 | 10.75 | |
| GTRPublication=TIP21, Model Category=Previous DGSS methods, Decoder Head=Mask2Former2023.12 | 43.7 | 39.1 | 39.6 | 40.8 | — | |
| ISW+AdvStyleBackbone=ResNet-101, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 43.44 | 41.96 | 40.32 | 41.91 | 10.44 | |
| AdvStylePublication=NIPS22, Model Category=Previous DGSS methods, Decoder Head=Mask2Former2023.12 | 43.4 | 42 | 40.3 | 41.9 | — | |
| MAE-LPublication=CVPR22, Model Category=Frozen backbone of VFMs, Backbone=ViT-L, Decoder Head=Mask2Former2023.12 | 43.3 | 48 | 37.8 | 43 | — | |
| MAEBackbone=MAE (Large), Fine-tune Method=Freeze, Trainable Params=0.00M2023.12 | 43.3 | 48 | 37.8 | 43 | — | |
| DRPCBackbone=ResNet-101, Training Set=Whole set (24,966), Evaluation Checkpoint=Best, Auxiliary ImageNet Data=true2022.07 | 42.53 | 38.05 | 38.72 | 39.76 | 9.88 | |
| DRPCBackbone=ResNet-101, Access to target-domain data=false2021.03 | 42.5 | 38 | 38.7 | 39.8 | — | |
| MinEntBackbone=ResNet-101, Access to target-domain data=true2021.03 | 42.3 | 38.5 | 34.4 | 38.4 | — | |
| AdaSeg.Backbone=ResNet-101, Access to target-domain data=true2021.03 | 41.4 | 38.3 | 36.2 | 38.6 | — | |
| IBN-NetBackbone=ResNet-101, Access to target-domain data=false2021.03 | 40.3 | 35.9 | 35.6 | 37.2 | — | |
| IBN-NetBackbone=ResNet-101, Training Set=Whole set (24,966), Evaluation Checkpoint=Best, Auxiliary ImageNet Data=false2022.07 | 40.3 | 35.9 | 35.6 | 37.26 | 7.73 | |
| Baseline+AdvStyleBackbone=ResNet-50, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 39.62 | 37 | 35.54 | 37.39 | 9.97 | |
| ISW+AdvStyleBackbone=ResNet-50, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 39.6 | 41.89 | 38.59 | 40.03 | 12.61 | |
| Baseline+AdvStyleBackbone=ResNet-101, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 39.52 | 36.1 | 36.39 | 37.34 | 5.87 | |
| IBN-Net+AdvStyleBackbone=ResNet-50, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 39.32 | 40.82 | 36.42 | 38.85 | 11.43 | |
| IDABackbone=VGG-16, Access to target-domain data=true2021.03 | 38.5 | 34.2 | 32.3 | 35 | — | |
| FSDRBackbone=VGG-16, Access to target-domain data=false2021.03 | 38.3 | 37.6 | 34.4 | 37.1 | — | |
| CBSTBackbone=VGG-16, Access to target-domain data=true2021.03 | 38.1 | 34.6 | 33.9 | 35.5 | — | |
| FDABackbone=VGG-16, Access to target-domain data=true2021.03 | 37.9 | 33.8 | 32.1 | 34.6 | — | |
| BlindNetBackbone=MobileNetV2, External Module=No2024.03 | 37.66 | 40.4 | 36.1 | 38.05 | — | |
| DPCLBackbone=MobileNetV2, External Module=Yes2024.03 | 37.57 | 40.3 | 35.45 | 37.77 | — | |
| ISWBackbone=ResNet-101, Training Set=Whole set (24,966), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 37.51 | 36.12 | 33.54 | 35.72 | — | |
| DRPCBackbone=ResNet-50, Training Set=Whole set (24,966), Evaluation Checkpoint=Best, Auxiliary ImageNet Data=true2022.07 | 37.42 | 34.12 | 32.14 | 34.56 | 6.28 | |
| IBN-NetBackbone=ResNet-101, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 37.37 | 36.81 | 34.21 | 36.13 | 4.66 | |
| ISWBackbone=ResNet-101, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 37.2 | 35.57 | 33.36 | 35.38 | 3.91 | |
| ISWBackbone=ResNet-50, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 36.58 | 40.33 | 35.2 | 37.37 | 9.95 | |
| DRPCBackbone=VGG-16, Access to target-domain data=false2021.03 | 36.1 | 32.3 | 31.6 | 33.3 | — | |
| AdaSeg.Backbone=VGG-16, Access to target-domain data=true2021.03 | 35 | 32.6 | 31.3 | 33 | — | |
| IBN-NetBackbone=VGG-16, Access to target-domain data=false2021.03 | 34.8 | 31 | 30.4 | 32 | — | |
| DIRLBackbone=MobileNetV2, External Module=Yes2024.03 | 34.67 | 34.31 | 32.78 | 33.92 | — | |
| SiamDoGeBackbone=MobileNetV2, External Module=No2024.03 | 34.15 | 32.34 | 34.5 | 33.67 | — | |
| IBN-NetBackbone=ResNet-50, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 33.85 | 37.75 | 32.3 | 34.63 | 7.21 | |
| BaselineBackbone=ResNet-101, Training Set=Whole set (24,966), Evaluation Checkpoint=Best, Auxiliary ImageNet Data=false2022.07 | 33.56 | 28.33 | 27.76 | 29.88 | — | |
| BaselineBackbone=ResNet-101, Training Set=Whole set (24,966), Evaluation Checkpoint=Best, Auxiliary ImageNet Data=false2022.07 | 33.4 | 27.9 | 27.3 | 29.53 | — | |
| BaselineBackbone=ResNet-101, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 32.97 | 30.68 | 30.77 | 31.47 | — | |
| MinEntBackbone=VGG-16, Access to target-domain data=true2021.03 | 32.8 | 30.7 | 29.5 | 31 | — | |
| BaselineBackbone=ResNet-50, Training Set=Whole set (24,966), Evaluation Checkpoint=Best, Auxiliary ImageNet Data=false2022.07 | 32.45 | 25.66 | 26.73 | 28.28 | — | |
| IterNormBackbone=ResNet-50, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 31.81 | 33.88 | 32.7 | 32.79 | 5.37 | |
| RobustNetBackbone=MobileNetV2, External Module=No2024.03 | 30.86 | 30.67 | 30.05 | 30.52 | — | |
| IBN-NetBackbone=MobileNetV2, External Module=No2024.03 | 30.14 | 27.07 | 27.66 | 28.29 | — | |
| SWBackbone=ResNet-50, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 29.91 | 29.71 | 27.48 | 29.03 | 1.61 | |
| IBN-NetBackbone=ResNet-50, Training Set=Whole set (24,966), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 29.6 | — | — | — | 7.4 | |
| BaselineBackbone=ResNet-50, Training Set=Training set (12,403), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 28.95 | 28.18 | 25.14 | 27.42 | — | |
| BaselineBackbone=MobileNetV2, External Module=No2024.03 | 25.84 | 26.45 | 25.73 | 26.04 | — | |
| BaselineBackbone=ResNet-50, Training Set=Whole set (24,966), Evaluation Checkpoint=Last, Auxiliary ImageNet Data=false2022.07 | 22.2 | — | — | — | — |