Multi-task Learning on NYUD v2 (mIoU, RMSE, odsF)
60.22mIoU (Semantic Segmentation)PRISM
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| PRISMBackbone=ViT-B2026.06 | 60.22 | 0.4883 | 76.59 | 17.81 | 10.59 | |
| SAKBackbone=ViT-B2026.06 | 59.93 | 0.4942 | 78.6 | 17.6 | 11.11 | |
| RADIOv2.5Backbone=ViT-B2026.06 | 57.19 | 0.498 | — | 20.04 | — | |
| RADIOBackbone=ViT-B2026.06 | 55.03 | 0.5186 | 77.97 | 18.49 | 6.33 | |
| TheiaBackbone=ViT-B2026.06 | 51.8 | 0.5367 | 76.08 | 19.7 | 1.83 | |
| SEMBackbone=ViT-B2026.06 | 51.34 | 0.5222 | 77.6 | 18.95 | 3.67 | |
| TSPBackbone=ViT-B2026.06 | 51.22 | 0.5301 | 76.9 | 18.78 | 3.26 | |
| Single-task baselineBackbone=ViT-B2026.06 | 51.15 | 0.5792 | 77.35 | 19.77 | 0 | |
| BFCIBackbone=ViT-B2026.06 | 51.14 | 0.5186 | 77.98 | 18.92 | 3.89 | |
| ECSBackbone=ViT-B2026.06 | 50.46 | 0.5332 | 77.89 | 18.42 | 3.53 | |
| TaskPrompterBackbone=ViT-B2026.06 | 50.4 | 0.5402 | 77.6 | 18.91 | 2.49 | |
| InvPTBackbone=ViT-B2026.06 | 50.3 | 0.5367 | 77.6 | 19 | 2.47 | |
| InvPT++Backbone=ViT-B2026.06 | 49.79 | 0.5318 | 77.1 | 18.9 | 2.4 | |
| Multi-task baselineBackbone=ViT-B2026.06 | 49.27 | 0.5823 | 75.88 | 19.92 | -1.72 | |
| Single TaskBackbone=Swin Transformer Tiny, Pre-trained=ImageNet-22K, Decoder=HRNet, Trainable Parameters (M)=112.642026.03 | 42.59 | 66.08 | 59.8 | 22.58 | 0 | |
| Free SinewichBackbone=Swin Transformer Tiny, Pre-trained=ImageNet-22K, Decoder=HRNet, Rank (r)=64, Trainable Parameters (M)=6.552026.03 | 42.26 | 64.08 | 59.4 | 23.41 | -0.52 | |
| UNICBackbone=ViT-B2026.06 | 42.21 | 0.6172 | — | 22.78 | — | |
| MTL - Full Fine TuningBackbone=Swin Transformer Tiny, Pre-trained=ImageNet-22K, Decoder=HRNet, Trainable Parameters (M)=30.082026.03 | 42.07 | 65.36 | 58.8 | 23.74 | -1.73 | |
| TGLoRA (attn)Backbone=Swin, Trainable Params (M)=3.152025.09 | 41.92 | 0.6319 | — | 25.27 | 1.68 | |
| TGLoRA (attn + mlp)Backbone=Swin, Trainable Params (M)=5.932025.09 | 41.89 | 0.6236 | — | 24.45 | 0.12 | |
| Single Task – LoRA (attn + mlp)Backbone=Swin, Trainable Params (M)=5.932025.09 | 41.86 | 0.6295 | — | 24.57 | 0.63 | |
| Single Task – Full Fine-TuningBackbone=Swin, Trainable Params (M)=84.042025.09 | 41.85 | 0.6322 | — | 24.01 | 0 | |
| TGLoRA (attn + mlp + others)Backbone=Swin, Trainable Params (M)=7.532025.09 | 41.84 | 0.6177 | — | 24.38 | 0.24 | |
| Free SinewichBackbone=Swin Transformer Tiny, Pre-trained=ImageNet-22K, Decoder=HRNet, Rank (r)=32, Trainable Parameters (M)=4.062026.03 | 41.8 | 66.67 | 58.8 | 24.67 | -3.41 | |
| MTLoRABackbone=Swin, r=64, Trainable Params (M)=7.812025.09 | 41.52 | 0.6212 | — | 24.99 | 1.04 | |
| TADFormerBackbone=Swin Transformer Tiny, Pre-trained=ImageNet-22K, Decoder=HRNet, Rank (r)=64, Trainable Parameters (M)=7.402026.03 | 41.37 | 64.1 | 58.5 | 24.54 | -2.68 | |
| MTL – Full Fine-TuningBackbone=Swin, Trainable Params (M)=29.002025.09 | 41.17 | 0.6217 | — | 24.75 | 1.01 | |
| MTLoRABackbone=Swin Transformer Tiny, Pre-trained=ImageNet-22K, Decoder=HRNet, Rank (r)=64, Trainable Parameters (M)=8.362026.03 | 41.11 | 65.49 | 58.3 | 24.55 | -3.45 | |
| MTL – LoRA (attn + mlp)Backbone=Swin, Trainable Params (M)=5.932025.09 | 41.05 | 0.6231 | — | 25.01 | 1.54 | |
| Free SinewichBackbone=Swin Transformer Tiny, Pre-trained=ImageNet-22K, Decoder=HRNet, Rank (r)=16, Trainable Parameters (M)=2.812026.03 | 40.9 | 67.15 | 58.5 | 25.06 | -4.68 | |
| DiTASK - MTLBackbone=Swin Transformer Tiny, Pre-trained=ImageNet-22K, Decoder=HRNet, Trainable Parameters (M)=3.572026.03 | 37.36 | 75 | 57.1 | 28.63 | -14.27 | |
| MTL – Decoder OnlyBackbone=Swin, Trainable Params (M)=1.482025.09 | 35.97 | 0.8008 | — | 32.63 | 25.54 | |
| MTL - Tuning Decoders OnlyBackbone=Swin Transformer Tiny, Pre-trained=ImageNet-22K, Decoder=HRNet, Trainable Parameters (M)=1.962026.03 | 34.34 | 84.47 | 57.4 | 32.93 | -24.26 |