Semantic Segmentation on ADE20K (fine-tuning) (mIoU)
54.4mIoUSoftmax
Evaluation Results
| Method | Links | |
|---|---|---|
| SoftmaxBackbone=SigLIP-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=310.60, Peak Mem. (GB)=1.3181, Throughput (imgs/s)=36.52, Segmentation Head=Mask2former2026.03 | 54.4 | |
| ViT-AdaLA (Ours)Backbone=SigLIP-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Segmentation Head=Mask2former2026.03 | 53.55 | |
| ViT-AdaLA (Stage 2)Backbone=SigLIP-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Segmentation Head=Mask2former2026.03 | 51.39 | |
| SoftmaxBackbone=IN1K ViT-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=310.60, Peak Mem. (GB)=1.3181, Throughput (imgs/s)=36.52, Segmentation Head=Mask2former2026.03 | 50.83 | |
| ViT-AdaLA (Ours)Backbone=IN1K ViT-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Segmentation Head=Mask2former2026.03 | 49.75 | |
| ViT-AdaLA (Stage 2)Backbone=IN1K ViT-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=41.56↑16.1%, Segmentation Head=Mask2former2026.03 | 46.92 | |
| MonarchBackbone=IN1K ViT-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=269.44↓13.3%, Peak Mem. (GB)=1.2304↓6.7%, Throughput (imgs/s)=18.31↓48.9%, Segmentation Head=Mask2former2026.03 | 45.05 | |
| NystromformerBackbone=IN1K ViT-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=265.20↓14.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=18.29↓50.8%, Segmentation Head=Mask2former2026.03 | 41.67 | |
| MonarchBackbone=SigLIP-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=269.44↓13.3%, Peak Mem. (GB)=1.2304↓6.7%, Throughput (imgs/s)=18.31↓48.9%, Segmentation Head=Mask2former2026.03 | 38.87 | |
| NystromformerBackbone=SigLIP-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=265.20↓14.6%, Peak Mem. (GB)=1.2163↓7.7%, Throughput (imgs/s)=18.29↓50.8%, Segmentation Head=Mask2former2026.03 | 32.54 | |
| PerformerBackbone=IN1K ViT-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=265.41↓14.6%, Peak Mem. (GB)=1.2164↓7.7%, Throughput (imgs/s)=36.48↑0.1%, Segmentation Head=Mask2former2026.03 | 31.01 | |
| CosformerBackbone=IN1K ViT-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=265.41↓14.6%, Peak Mem. (GB)=1.2226↓7.2%, Throughput (imgs/s)=39.55↑8.2%, Segmentation Head=Mask2former2026.03 | 29.65 | |
| HedgehogBackbone=IN1K ViT-L, Res.=512^2, Params (M)=305.77, FLOPS (G)=265.41↓14.5%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=37.44↑2.5%, Segmentation Head=Mask2former2026.03 | 25.15 | |
| PerformerBackbone=SigLIP-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=265.41↓14.6%, Peak Mem. (GB)=1.2164↓7.7%, Throughput (imgs/s)=36.48↑0.1%, Segmentation Head=Mask2former2026.03 | 23.97 | |
| CosformerBackbone=SigLIP-L, Res.=512^2, Params (M)=304.20, FLOPS (G)=265.41↓14.6%, Peak Mem. (GB)=1.2226↓7.2%, Throughput (imgs/s)=39.55↑8.2%, Segmentation Head=Mask2former2026.03 | 23.08 | |
| HedgehogBackbone=SigLIP-L, Res.=512^2, Params (M)=305.77, FLOPS (G)=265.41↓14.5%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=37.44↑2.5%, Segmentation Head=Mask2former2026.03 | 22.13 | |
| LoLCATSBackbone=IN1K ViT-L, Res.=512^2, Params (M)=305.77, FLOPS (G)=265.41↓14.5%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=37.44↑2.5%, Segmentation Head=Mask2former2026.03 | 20.17 | |
| LoLCATSBackbone=SigLIP-L, Res.=512^2, Params (M)=305.77, FLOPS (G)=265.41↓14.5%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=37.44↑2.5%, Segmentation Head=Mask2former2026.03 | 20.11 | |
| LinformerBackbone=SigLIP-L, Res.=512^2, Params (M)=305.77, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=45.41↑25.3%, Segmentation Head=Mask2former2026.03 | 12.37 | |
| LinformerBackbone=IN1K ViT-L, Res.=512^2, Params (M)=305.77, FLOPS (G)=262.19↓15.6%, Peak Mem. (GB)=1.2221↓7.3%, Throughput (imgs/s)=45.41↑25.3%, Segmentation Head=Mask2former2026.03 | 11.49 |