Semantic Segmentation on Cityscapes fine-tuning
80.98mIoUSoftmax
Evaluation Results
| Method | Links | |
|---|---|---|
| SoftmaxBackbone=DINOv2-L, Resolution=1024^2, Params (M)=304.20, FLOPS (G)=1241.0, Peak Mem. (GB)=3.2836, Throughput (imgs/s)=7.07, Segmentation Head=Mask2former2026.03 | 80.98 | |
| ViT-AdaLABackbone=DINOv2-L, Resolution=1024^2, Params (M)=304.20, FLOPS (G)=429.35↓65.4%, Peak Mem. (GB)=1.3764↓58.1%, Throughput (imgs/s)=15.95↑125.4%, Stage=Ours (Full), Segmentation Head=Mask2former2026.03 | 78.73 | |
| ViT-AdaLABackbone=DINOv2-L, Resolution=1024^2, Params (M)=304.20, FLOPS (G)=429.35↓65.4%, Peak Mem. (GB)=1.3764↓58.1%, Throughput (imgs/s)=15.95↑125.4%, Stage=Stage 2, Segmentation Head=Mask2former2026.03 | 77.53 | |
| SoftmaxBackbone=DINOv2-L, Resolution=512^2, Params (M)=304.20, FLOPS (G)=310.60, Peak Mem. (GB)=1.3181, Throughput (imgs/s)=36.52, Segmentation Head=Mask2former2026.03 | 74.86 | |
| ViT-AdaLABackbone=DINOv2-L, Resolution=512^2, Params (M)=304.20, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Stage=Ours (Full), Segmentation Head=Mask2former2026.03 | 72.4 | |
| ViT-AdaLABackbone=DINOv2-L, Resolution=512^2, Params (M)=304.20, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Stage=Stage 2, Segmentation Head=Mask2former2026.03 | 71.32 | |
| MonarchBackbone=DINOv2-L, Resolution=1024^2, Params (M)=304.20, FLOPS (G)=500.24↓59.7%, Peak Mem. (GB)=1.5469↓52.9%, Throughput (imgs/s)=9.74↑37.6%, Segmentation Head=Mask2former2026.03 | 55.18 | |
| MonarchBackbone=DINOv2-L, Resolution=512^2, Params (M)=304.20, FLOPS (G)=269.44↓13.3%, Peak Mem. (GB)=1.2304↓6.7%, Throughput (imgs/s)=18.31↓48.9%, Segmentation Head=Mask2former2026.03 | 50.84 | |
| NystromformerBackbone=DINOv2-L, Resolution=512^2, Params (M)=304.20, FLOPS (G)=265.20↓14.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=18.29↓50.8%, Segmentation Head=Mask2former2026.03 | 48.97 | |
| NystromformerBackbone=DINOv2-L, Resolution=1024^2, Params (M)=304.20, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3764↓58.1%, Throughput (imgs/s)=14.61↑106.5%, Segmentation Head=Mask2former2026.03 | 47.56 | |
| CosformerBackbone=DINOv2-L, Resolution=512^2, Params (M)=304.20, FLOPS (G)=265.41↓14.6%, Peak Mem. (GB)=1.2226↓7.2%, Throughput (imgs/s)=39.55↑8.2%, Segmentation Head=Mask2former2026.03 | 44.52 | |
| CosformerBackbone=DINOv2-L, Resolution=1024^2, Params (M)=304.20, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3945↓57.5%, Throughput (imgs/s)=15.29↑116.1%, Segmentation Head=Mask2former2026.03 | 44.5 | |
| HedgehogBackbone=DINOv2-L, Resolution=1024^2, Params (M)=305.77, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3823↓57.9%, Throughput (imgs/s)=15.38↑117.4%, Segmentation Head=Mask2former2026.03 | 44.17 | |
| HedgehogBackbone=DINOv2-L, Resolution=512^2, Params (M)=305.77, FLOPS (G)=265.41↓14.5%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=37.44↑2.5%, Segmentation Head=Mask2former2026.03 | 43.97 | |
| PerformerBackbone=DINOv2-L, Resolution=512^2, Params (M)=304.20, FLOPS (G)=265.41↓14.6%, Peak Mem. (GB)=1.2164↓7.7%, Throughput (imgs/s)=36.48↑0.1%, Segmentation Head=Mask2former2026.03 | 43.11 | |
| PerformerBackbone=DINOv2-L, Resolution=1024^2, Params (M)=304.20, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3765↓58.1%, Throughput (imgs/s)=15.23↑115.3%, Segmentation Head=Mask2former2026.03 | 42.58 | |
| LinformerBackbone=DINOv2-L, Resolution=512^2, Params (M)=305.77, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=45.41↑25.3%, Segmentation Head=Mask2former2026.03 | 37.24 | |
| LoLCATSBackbone=DINOv2-L, Resolution=512^2, Params (M)=305.77, FLOPS (G)=265.41↓14.5%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=37.44↑2.5%, Segmentation Head=Mask2former2026.03 | 34.71 | |
| LoLCATSBackbone=DINOv2-L, Resolution=1024^2, Params (M)=305.77, FLOPS (G)=442.24↓64.4%, Peak Mem. (GB)=1.3823↓57.9%, Throughput (imgs/s)=15.38↑117.4%, Segmentation Head=Mask2former2026.03 | 33.66 | |
| LinformerBackbone=DINOv2-L, Resolution=1024^2, Params (M)=305.77, FLOPS (G)=429.35↓65.4%, Peak Mem. (GB)=1.3999↓57.4%, Throughput (imgs/s)=17.83↑152.0%, Segmentation Head=Mask2former2026.03 | 26.63 |