Semantic Segmentation on Cityscapes (mean-IoU)
88.9mIoULRHP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LRHPTask Configuration=dual tasks of detection and segmentation2026.03 | 88.9 | 55 | |
| LRHPBackbone=Yolo Backbone, Task Configuration=dual tasks of detection and segmentation2026.03 | 88.4 | 96.4 | |
| UJS-refined2026.03 | 88.3 | — | |
| InternImage2026.03 | 86.1 | 79.5 | |
| HEM-Backbone=EfficientNet-b42025.01 | 82.26 | — | |
| HEM-Backbone=DenseNet2012025.01 | 81.28 | — | |
| HEM-Backbone=ResNeXt502025.01 | 80.98 | — | |
| UJS-base2026.03 | 80.5 | — | |
| HEM-Backbone=ResNet342025.01 | 80.02 | — | |
| SoftmaxBackbone=DINOv2-B2026.03 | 79.73 | — | |
| MSeg2026.03 | 77.6 | 65.7 | |
| SoftmaxBackbone=SigLIP-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=1241.0, Peak Mem. (GB)=3.2836, Throughput (imgs/s)=7.07, Segmentation head=Mask2former2026.03 | 76.53 | — | |
| ViT-AdaLABackbone=DINOv2-B, Pretraining Epochs=402026.03 | 74.6 | — | |
| HEMBackbone=ResNet342025.01 | 74.25 | — | |
| HEMBackbone=ResNeXt502025.01 | 74.21 | — | |
| ViT-AdaLA (Ours)Backbone=SigLIP-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=429.35↓65.4%, Peak Mem. (GB)=1.3764↓58.1%, Throughput (imgs/s)=15.95↑125.4%, Segmentation head=Mask2former2026.03 | 73.33 | — | |
| ViT-AdaLA (Stage 2)Backbone=SigLIP-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=429.35↓65.4%, Peak Mem. (GB)=1.3764↓58.1%, Throughput (imgs/s)=15.95↑125.4%, Segmentation head=Mask2former2026.03 | 72.41 | — | |
| SoftmaxBackbone=IN1K ViT-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=1241.0, Peak Mem. (GB)=3.2836, Throughput (imgs/s)=7.07, Segmentation head=Mask2former2026.03 | 72.21 | — | |
| HEMBackbone=DenseNet2012025.01 | 71.98 | — | |
| MMBackbone=DenseNet2012025.01 | 71.48 | — | |
| DICEBackbone=DenseNet2012025.01 | 70.97 | — | |
| SoftmaxBackbone=SigLIP-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=310.60, Peak Mem. (GB)=1.3181, Throughput (imgs/s)=36.52, Segmentation head=Mask2former2026.03 | 70.57 | — | |
| DICEBackbone=ResNet342025.01 | 70.44 | — | |
| DICEBackbone=EfficientNet-b42025.01 | 70.31 | — | |
| ViT-UpBackbone=DINOv3-B, Evaluation Protocol=Seg. Probing2026.06 | 69.81 | — | |
| LoCA‡Backbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=5.0M, GFLOPs=152, Pre-trained=DINO2026.07 | 69.73 | — | |
| SoMABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=4.3M, GFLOPs=152, Pre-trained=DINO2026.07 | 68.85 | — | |
| LoCABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=5.0M, GFLOPs=152, Pre-trained=DINO2026.07 | 68.54 | — | |
| ViT-AdaLA (Ours)Backbone=IN1K ViT-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=429.35↓65.4%, Peak Mem. (GB)=1.3764↓58.1%, Throughput (imgs/s)=15.95↑125.4%, Segmentation head=Mask2former2026.03 | 68.25 | — | |
| ViT-AdaLA (Ours)Backbone=SigLIP-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Segmentation head=Mask2former2026.03 | 68.2 | — | |
| HEMBackbone=EfficientNet-b42025.01 | 68.01 | — | |
| DICEBackbone=ResNeXt502025.01 | 67.44 | — | |
| ViT-AdaLA (Stage 2)Backbone=SigLIP-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Segmentation head=Mask2former2026.03 | 67.35 | — | |
| CEBackbone=ResNeXt502025.01 | 67.23 | — | |
| CEBackbone=DenseNet2012025.01 | 66.98 | — | |
| MMBackbone=ResNet342025.01 | 66.97 | — | |
| LoRA (Linear)Backbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=4.3M, GFLOPs=152, Pre-trained=DINO2026.07 | 66.95 | — | |
| SoMABackbone=ViT-B, Param.=86.5M, Trainable Param.=2.3M, GFLOPs=216, Pre-trained=DINO2026.07 | 66.71 | — | |
| FSFBackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=0.8M, GFLOPs=152, Pre-trained=DINO2026.07 | 66.57 | — | |
| CEBackbone=ResNet342025.01 | 66.49 | — | |
| LoCABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=3.4M, GFLOPs=81, Pre-trained=DINO2026.07 | 66.46 | — | |
| NAFBackbone=DINOv3-B, Evaluation Protocol=Seg. Probing2026.06 | 66.45 | — | |
| ViT-AdaLA (Stage 2)Backbone=IN1K ViT-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=429.35↓65.4%, Peak Mem. (GB)=1.3764↓58.1%, Throughput (imgs/s)=15.95↑125.4%, Segmentation head=Mask2former2026.03 | 66.42 | — | |
| MMBackbone=ResNeXt502025.01 | 65.83 | — | |
| LoRABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=25.9M, GFLOPs=152, Pre-trained=DINO2026.07 | 65.74 | — | |
| LoCA‡Backbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=3.4M, GFLOPs=81, Pre-trained=DINO2026.07 | 65.56 | — | |
| FFTBackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=196.2M, GFLOPs=152, Pre-trained=DINO2026.07 | 65.5 | — | |
| SAM 32025.11 | 65.2 | — | |
| SAM 32025.11 | 65.2 | — | |
| SoftmaxBackbone=IN1K ViT-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=310.60, Peak Mem. (GB)=1.3181, Throughput (imgs/s)=36.52, Segmentation head=Mask2former2026.03 | 65.11 | — | |
| SoMABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.9M, GFLOPs=81, Pre-trained=DINO2026.07 | 64.99 | — | |
| CoLoRABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=3.6M, GFLOPs=152, Pre-trained=DINO2026.07 | 64.51 | — | |
| BilinearBackbone=DINOv3-B, Evaluation Protocol=Seg. Probing2026.06 | 64.21 | — | |
| LoRABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=17.2M, GFLOPs=81, Pre-trained=DINO2026.07 | 64.17 | — | |
| ViT-AdaLA (Ours)Backbone=IN1K ViT-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Segmentation head=Mask2former2026.03 | 64.16 | — | |
| LoRA (Linear)Backbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.9M, GFLOPs=81, Pre-trained=DINO2026.07 | 63.9 | — | |
| CEBackbone=EfficientNet-b42025.01 | 63.2 | — | |
| CABackbone=ConvNeXt-L, Param.=196.2M, Trainable Param.=4.5M, GFLOPs=152, Pre-trained=DINO2026.07 | 63.16 | — | |
| ViT-AdaLA (Stage 2)Backbone=IN1K ViT-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Segmentation head=Mask2former2026.03 | 62.24 | — | |
| FFTBackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=87.56M, GFLOPs=81, Pre-trained=DINO2026.07 | 62.18 | — | |
| CoLoRABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.2M, GFLOPs=81, Pre-trained=DINO2026.07 | 61.87 | — | |
| FFTBackbone=ViT-B, Param.=86.5M, Trainable Param.=86.5M, GFLOPs=216, Pre-trained=DINO2026.07 | 60.84 | — | |
| MMBackbone=EfficientNet-b42025.01 | 60.81 | — | |
| FSFBackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=0.6M, GFLOPs=81, Pre-trained=DINO2026.07 | 60.15 | — | |
| CABackbone=ConvNeXt-B, Param.=87.56M, Trainable Param.=2.3M, GFLOPs=81, Pre-trained=DINO2026.07 | 59.94 | — | |
| LoCABackbone=MambaVision-L3, Param.=737.5M, Trainable Param.=9.0M, GFLOPs=1,556, Pre-trained=ImageNet21k2026.07 | 59.94 | — | |
| LABackbone=DenseNet2012025.01 | 55.84 | — | |
| LABackbone=ResNet342025.01 | 54.63 | — | |
| FFTBackbone=MambaVision-L3, Param.=737.5M, Trainable Param.=737.5M, GFLOPs=1,556, Pre-trained=ImageNet21k2026.07 | 52.88 | — | |
| LNBackbone=ResNet342025.01 | 52.84 | — | |
| LABackbone=EfficientNet-b42025.01 | 52.28 | — | |
| MonarchBackbone=IN1K ViT-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=500.24↓59.7%, Peak Mem. (GB)=1.5469↓52.9%, Throughput (imgs/s)=9.74↑37.6%, Segmentation head=Mask2former2026.03 | 52.18 | — | |
| LABackbone=ResNeXt502025.01 | 52 | — | |
| LNBackbone=DenseNet2012025.01 | 51.17 | — | |
| LNBackbone=ResNeXt502025.01 | 49.38 | — | |
| MonarchBackbone=IN1K ViT-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=269.44↓13.3%, Peak Mem. (GB)=1.2304↓6.7%, Throughput (imgs/s)=18.31↓48.9%, Segmentation head=Mask2former2026.03 | 48.35 | — | |
| MonarchBackbone=SigLIP-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=500.24↓59.7%, Peak Mem. (GB)=1.5469↓52.9%, Throughput (imgs/s)=9.74↑37.6%, Segmentation head=Mask2former2026.03 | 46.58 | — | |
| LNBackbone=EfficientNet-b42025.01 | 46.19 | — | |
| NystromformerBackbone=IN1K ViT-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=265.20↓14.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=18.29↓50.8%, Segmentation head=Mask2former2026.03 | 45.58 | — | |
| LoCABackbone=MambaVision-B, Param.=96.7M, Trainable Param.=2.5M, GFLOPs=211, Pre-trained=ImageNet21k2026.07 | 45.21 | — | |
| LoCABackbone=ResNet101, Param.=42.3M, Trainable Param.=2.8M, GFLOPs=42, Pre-trained=ImageNet21k2026.07 | 44.82 | — | |
| APE-D*training=partially trained on LVIS2025.11 | 44.2 | — | |
| APE-D2025.11 | 44.2 | — | |
| MonarchBackbone=SigLIP-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=269.44↓13.3%, Peak Mem. (GB)=1.2304↓6.7%, Throughput (imgs/s)=18.31↓48.9%, Segmentation head=Mask2former2026.03 | 43.94 | — | |
| NystromformerBackbone=SigLIP-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=265.20↓14.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=18.29↓50.8%, Segmentation head=Mask2former2026.03 | 43.52 | — | |
| NystromformerBackbone=IN1K ViT-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3764↓58.1%, Throughput (imgs/s)=14.61↑106.5%, Segmentation head=Mask2former2026.03 | 43.15 | — | |
| BootlegArch=ViT-L/16, Data=IN-1k, Ep.=600, Probe=Blk2026.03 | 42.8 | — | |
| NystromformerBackbone=SigLIP-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3764↓58.1%, Throughput (imgs/s)=14.61↑106.5%, Segmentation head=Mask2former2026.03 | 41.86 | — | |
| FFTBackbone=ResNet101, Param.=42.3M, Trainable Param.=42.3M, GFLOPs=42, Pre-trained=ImageNet21k2026.07 | 41.29 | — | |
| SoMA†Backbone=ResNet101, Param.=42.3M, Trainable Param.=2.5M, GFLOPs=42, Pre-trained=ImageNet21k2026.07 | 41.23 | — | |
| PerformerBackbone=IN1K ViT-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3765↓58.1%, Throughput (imgs/s)=15.23↑115.3%, Segmentation head=Mask2former2026.03 | 40.86 | — | |
| CosformerBackbone=SigLIP-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=265.41↓14.6%, Peak Mem. (GB)=1.2226↓7.2%, Throughput (imgs/s)=39.55↑8.2%, Segmentation head=Mask2former2026.03 | 40.56 | — | |
| PerformerBackbone=SigLIP-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3765↓58.1%, Throughput (imgs/s)=15.23↑115.3%, Segmentation head=Mask2former2026.03 | 40.53 | — | |
| HedgehogBackbone=SigLIP-L, Res.=1024^2, Params (M)=305.72, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3823↓57.9%, Throughput (imgs/s)=15.38↑117.4%, Segmentation head=Mask2former2026.03 | 40.17 | — | |
| CosformerBackbone=IN1K ViT-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3945↓57.5%, Throughput (imgs/s)=15.29↑116.1%, Segmentation head=Mask2former2026.03 | 40.14 | — | |
| PerformerBackbone=SigLIP-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=265.41↓14.6%, Peak Mem. (GB)=1.2164↓7.7%, Throughput (imgs/s)=36.48↑0.1%, Segmentation head=Mask2former2026.03 | 39.93 | — | |
| CosformerBackbone=SigLIP-L, Res.=1024^2, Params (M)=304.15, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3945↓57.5%, Throughput (imgs/s)=15.29↑116.1%, Segmentation head=Mask2former2026.03 | 39.9 | — | |
| BootlegArch=ViT-B/16, Data=IN-1k, Ep.=600, Probe=Blk2026.03 | 39.7 | — | |
| HedgehogBackbone=SigLIP-L, Res.=512^2, Params (M)=305.72, FLOPS (G)=265.41↓14.5%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=37.44↑2.5%, Segmentation head=Mask2former2026.03 | 39.53 | — | |
| PerformerBackbone=IN1K ViT-L, Res.=512^2, Params (M)=304.15, FLOPS (G)=265.41↓14.6%, Peak Mem. (GB)=1.2164↓7.7%, Throughput (imgs/s)=36.48↑0.1%, Segmentation head=Mask2former2026.03 | 39.44 | — |