Semantic Segmentation on GTA5 to {Cityscapes, BDD100K, Mapillary}
68.88Score (Cityscapes)tqdm
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| tqdmBackbone=EVA02-L, Pre-training=EVA02-CLIP, Input Resolution=1024x10242024.07 | 68.88 | 59.18 | 70.1 | 66.05 | |
| ReinBackbone=ViT-L, Pre-training=DINOv2, Input Resolution=1024x10242024.07 | 66.4 | 60.4 | 66.1 | 64.3 | |
| VLTSegBackbone=EVA02-L, Pre-training=EVA02-CLIP, Input Resolution=1024x10242024.07 | 65.6 | 58.4 | 66.5 | 63.5 | |
| ReinBackbone=EVA02-L, Pre-training=EVA02-CLIP, Input Resolution=1024x10242024.07 | 65.3 | 60.5 | 64.9 | 63.6 | |
| CLOUDSEncoder=ConvNeXt-L, Training=GTA52023.12 | 60.2 | 57.4 | 67 | 61.5 | |
| CLOUDSEncoder=MiT B5, Pre-training=ImageNet, Training=GTA52023.12 | 58.1 | 53.8 | 62.3 | 58.1 | |
| tqdmBackbone=ViT-B, Pre-training=CLIP, Input Resolution=512x5122024.07 | 57.5 | 47.66 | 59.76 | 54.97 | |
| HRDAEncoder=MiT B5, Pre-training=ImageNet, Training=GTA52023.12 | 57.4 | 49.1 | 61.1 | 55.9 | |
| IBAFormerBackbone=MiT-B5, Pre-training=CLIP, Input Resolution=512x5122024.07 | 56.34 | 49.76 | 58.26 | 54.79 | |
| FC-CLIPEncoder=ConvNeXt-L, Pre-training=LAION-2B, Training=COCO Panoptic2023.12 | 56.2 | 54.2 | 60.6 | 57 | |
| CLOUDSEncoder=ResNet-101, Pre-training=WIT†, Training=GTA52023.12 | 55.7 | 49.3 | 59 | 54.7 | |
| CLOUDSEncoder=ResNet-50, Pre-training=WIT†, Training=GTA52023.12 | 54.6 | 46.7 | 58.6 | 53.3 | |
| ODISEEncoder=Diffusion, Training=COCO Panoptic2023.12 | 53.8 | 53.6 | 59.1 | 55.5 | |
| FC-CLIPEncoder=ConvNeXt-L, Training=GTA5, official_code=true2023.12 | 53.6 | 47.6 | 57.4 | 52.9 | |
| SHADEBackbone=MiT-B5, Pre-training=CLIP, Input Resolution=512x5122024.07 | 53.27 | 48.19 | 54.99 | 52.15 | |
| PTDiffSegEncoder=Diffusion, Pre-training=LAION-5B, Training=GTA52023.12 | 52 | — | — | — | |
| CLOUDSEncoder=ResNet-101, Pre-training=ImageNet, Training=GTA52023.12 | 50.6 | 44.8 | 56.6 | 50.7 | |
| FAMixBackbone=RN101, Pre-training=CLIP, Input Resolution=512x5122024.07 | 49.47 | 46.4 | 51.97 | 49.28 | |
| MoDifyEncoder=ResNet-101, Pre-training=ImageNet, Training=GTA52023.12 | 48.8 | 44.2 | 47.5 | 46.8 | |
| TLDREncoder=ResNet-101, Pre-training=ImageNet, Training=GTA52023.12 | 47.6 | 44.9 | 48.8 | 47.1 | |
| TLDRBackbone=RN101, Pre-training=CLIP, Input Resolution=512x5122024.07 | 47.58 | 44.88 | 48.8 | 47.09 | |
| VLTSegBackbone=ViT-B, Pre-training=CLIP, Input Resolution=512x5122024.07 | 47.5 | 45.7 | 54.3 | 49.17 | |
| SHADEBackbone=RN101, Pre-training=CLIP, Input Resolution=512x5122024.07 | 46.66 | 43.66 | 45.5 | 45.27 | |
| SHADEEncoder=ResNet-101, Pre-training=ImageNet, Training=GTA52023.12 | 46.6 | 43.7 | 45.5 | 45.3 | |
| TLDREncoder=ResNet-50, Pre-training=ImageNet, Training=GTA52023.12 | 46.5 | 42.6 | 46.2 | 45.1 | |
| WildNetBackbone=RN101, Pre-training=CLIP, Input Resolution=512x5122024.07 | 45.79 | 41.73 | 47.08 | 44.87 | |
| MoDifyEncoder=ResNet-50, Pre-training=ImageNet, Training=GTA52023.12 | 45.7 | 40.1 | 46.2 | 44 | |
| SAN-SAWBackbone=RN101, Pre-training=CLIP, Input Resolution=512x5122024.07 | 45.33 | 41.18 | 40.77 | 42.43 | |
| CAT-SegEncoder=ViT-G/14, Training=COCO-Stuff2023.12 | 45 | 47.6 | 51.8 | 48.2 | |
| SHADEEncoder=ResNet-50, Pre-training=ImageNet, Training=GTA52023.12 | 44.7 | 39.3 | 43.3 | 42.4 | |
| Grounding-SAMEncoder=ViT-H, Pre-training=SA-1B2023.12 | 43.5 | 39.4 | 48.4 | 43.8 | |
| HRDAEncoder=ResNet-101, Pre-training=ImageNet, Training=GTA5, official_code=true2023.12 | 39.6 | 38.7 | 42.2 | 40.1 | |
| IBN-NetEncoder=ResNet-101, Pre-training=ImageNet, Training=GTA52023.12 | 37.4 | 34.2 | 36.8 | 36.1 | |
| ISWEncoder=ResNet-101, Pre-training=ImageNet, Training=GTA52023.12 | 37.2 | 33.4 | 35.6 | 35.4 | |
| ISWEncoder=ResNet-50, Pre-training=ImageNet, Training=GTA52023.12 | 36.6 | 35.2 | 40.3 | 37.4 | |
| IBN-NetEncoder=ResNet-50, Pre-training=ImageNet, Training=GTA52023.12 | 33.9 | 32.3 | 37.8 | 34.6 |