Semantic Segmentation on Cityscapes, BDD100K, and Mapillary Aggregate
70.44Average mIoUtqdm
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| tqdmBackbone=EVA02-L, Pre-training=EVA02-CLIP, Input Resolution=1024x10242024.07 | 70.44 | — | — | 64.72 | 76.15 | |
| VLTSegBackbone=EVA02-L, Pre-training=EVA02-CLIP, Input Resolution=1024x10242024.07 | 70.4 | — | — | 64.4 | 76.4 | |
| ReinBackbone=DINOv2-L [58], Trainable Parameters=2.99M2023.12 | 68.7 | 65 | 72.3 | — | — | |
| ReinBackbone=ViT-L, Pre-training=DINOv2, Input Resolution=1024x10242024.07 | 68.65 | — | — | 65 | 72.3 | |
| HGFormerBackbone=Swin-L [52], Trainable Parameters=196.03M2023.12 | 66.8 | 61.5 | 72.1 | — | — | |
| ReinBackbone=EVA02-L [18], Trainable Parameters=2.99M2023.12 | 66.8 | 64.1 | 69.5 | — | — | |
| HGFormerBackbone=Swin-L, Pre-training=CLIP, Input Resolution=512x5122024.07 | 66.8 | — | — | 61.5 | 72.1 | |
| ReinBackbone=EVA02-L, Pre-training=EVA02-CLIP, Input Resolution=1024x10242024.07 | 66.8 | — | — | 64.1 | 69.5 | |
| FreezeBackbone=DINOv2-L [58], Trainable Parameters=0.00M2023.12 | 66.7 | 63.4 | 69.7 | — | — | |
| FreezeBackbone=EVA02-L [18], Trainable Parameters=0.00M2023.12 | 60.8 | 57.8 | 63.8 | — | — | |
| tqdmBackbone=ViT-B, Pre-training=CLIP, Input Resolution=512x5122024.07 | 58.14 | — | — | 50.54 | 65.74 | |
| SAN-SAWBackbone=RN101, Pre-training=CLIP, Input Resolution=512x5122024.07 | 58 | — | — | 54.73 | 61.27 | |
| SAN-SAWBackbone=ResNet50 [26], Trainable Parameters=23.58M2023.12 | 56.4 | 53 | 59.8 | — | — | |
| SHADEBackbone=RN101, Pre-training=CLIP, Input Resolution=512x5122024.07 | 55.81 | — | — | 50.95 | 60.67 | |
| WildNetBackbone=ResNet101 [26], Trainable Parameters=42.62M2023.12 | 54.9 | 50.9 | 58.8 | — | — | |
| GTRBackbone=ResNet50 [26], Trainable Parameters=23.58M2023.12 | 54 | 50.8 | 57.2 | — | — | |
| DRPCBackbone=ResNet50 [26], Trainable Parameters=23.58M2023.12 | 53.1 | 49.9 | 56.3 | — | — | |
| IBNBackbone=ResNet50 [26], Trainable Parameters=23.58M2023.12 | 52.8 | 48.6 | 57 | — | — | |
| WildNetBackbone=RN101, Pre-training=CLIP, Input Resolution=512x5122024.07 | 48.98 | — | — | 47.01 | 50.94 |