Multi-Task Learning on PASCAL Context
82.2mIoU (Semantic Segmentation)PRISM
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| PRISMBackbone=ViT-B2026.06 | 82.2 | 75.34 | — | — | 2.29 | 84.81 | 13.47 | 75.92 | |
| SAKBackbone=ViT-B2026.06 | 81.88 | 74.3 | — | — | 0.83 | 84.79 | 14.02 | 74.09 | |
| RADIOv2.5Backbone=ViT-B2026.06 | 81.75 | 71.49 | — | — | — | 81.26 | 16.1 | — | |
| Single-task baselineBackbone=ViT-B2026.06 | 80.25 | 70.54 | — | — | 0 | 84.54 | 13.57 | 74.22 | |
| MLoREBackbone=ViT-B2026.06 | 79.26 | 67.82 | — | — | -0.83 | 85.31 | 13.65 | 74.69 | |
| TaskPrompterBackbone=ViT-B2026.06 | 79 | 67 | — | — | -1.24 | 85.05 | 13.47 | 73.5 | |
| TaskExpertBackbone=ViT-B2026.06 | 78.45 | 67.38 | — | — | -1.73 | 84.96 | 13.55 | 72.3 | |
| RADIOBackbone=ViT-B2026.06 | 78.06 | 68.13 | — | — | -1.53 | 85.18 | 13.59 | 72.64 | |
| BFCIBackbone=ViT-B2026.06 | 77.98 | 68.19 | — | — | -1.31 | 85.06 | 13.48 | 72.98 | |
| InvPTBackbone=ViT-B2026.06 | 77.33 | 66.62 | — | — | -2.28 | 85.14 | 13.78 | 73.2 | |
| TSσBNBackbone=ViT-S, FLOPs (G)=214, Parameters (M)=292025.12 | 77.12 | 64.73 | — | — | — | 85.24 | 14.04 | 70 | |
| InvPT++Backbone=ViT-B2026.06 | 76.95 | 66.89 | — | — | -1.92 | 85.12 | 13.54 | 73.3 | |
| Multi-task baselineBackbone=ViT-B2026.06 | 76.76 | 65.26 | — | — | -4.04 | 84.39 | 13.98 | 70.37 | |
| TheiaBackbone=ViT-B2026.06 | 76.51 | 67.53 | — | — | -4.33 | 84.38 | 14.56 | 70.34 | |
| DITASKBackbone=Swin-Large, Trainable Swin Parameters (M)=7.13, Single Inference For All Tasks=true2025.02 | 76.23 | 67.53 | 64.07 | 16.9 | 7.79 | — | — | — | |
| TSBNBackbone=ViT-S, FLOPs (G)=214, Parameters (M)=292025.12 | 75.95 | 63.33 | — | — | — | 84.655 | 14.16 | 68.05 | |
| UNICBackbone=ViT-B2026.06 | 75.9 | 62.85 | — | — | — | 81.84 | 15.78 | — | |
| DITASKBackbone=Swin-Base, Trainable Swin Parameters (M)=3.14, Single Inference For All Tasks=true2025.02 | 75.86 | 65.97 | 64.18 | 17.29 | 6.52 | — | — | — | |
| MLoREBackbone=ViT-S, FLOPs (G)=72, Parameters (M)=442025.12 | 75.64 | 62.65 | — | — | — | 84.7 | 14.43 | 69.81 | |
| TaskExpertBackbone=ViT-S, FLOPs (G)=204, Parameters (M)=552025.12 | 75.04 | 62.68 | — | — | — | 84.68 | 14.22 | 68.8 | |
| DITASKBackbone=Swin-Small, Trainable Swin Parameters (M)=1.66, Single Inference For All Tasks=true2025.02 | 74.49 | 63.2 | 64.58 | 17.58 | 4.68 | — | — | — | |
| Mod-SquadBackbone=ViT-S, FLOPs (G)=420, Parameters (M)=522025.12 | 74.1 | 62.7 | — | — | — | 66.9 | 13.7 | 72 | |
| M3ViTBackbone=ViT-S, FLOPs (G)=420, Parameters (M)=422025.12 | 72.8 | 62.1 | — | — | — | 66.3 | 14.5 | 71.7 | |
| Single Task - DITASKProtocol=Ours, Trainable Swin Parameters (M)=1.60 (x4), Single Inference For All Tasks=false, Backbone=Swin-Tiny2025.02 | 72.2 | 62.33 | 65.7 | 16.55 | 5.33 | — | — | — | |
| FAARBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Initial Rank (r_init)=64, Trainable Parameters (M)=3.38, Single inference (all tasks)=True2026.03 | 72.02 | 61.25 | 66.11 | 16.35 | 5.28 | — | — | — | |
| HyperFormerProtocol=Adapter-Based, Trainable Swin Parameters (M)=70.83, Single Inference For All Tasks=false2025.02 | 71.43 | 60.73 | 65.54 | 17.77 | 2.64 | — | — | — | |
| HyperFormerBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=72.77 M2025.12 | 71.43 | 60.73 | 65.54 | — | 2.64 | — | 17.77 | — | |
| HyperFormerBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=72.77, Single inference (all tasks)=False2026.03 | 71.43 | 60.73 | 65.54 | 17.77 | 2.64 | — | — | — | |
| HyperformerBackbone=Swin, Trainable Params (M)=72.772025.09 | 71.43 | 60.73 | 65.54 | 17.77 | 2.64 | — | — | — | |
| PolyhistorProtocol=Adapter-Based, Trainable Swin Parameters (M)=7.02, Single Inference For All Tasks=false2025.02 | 70.87 | 59.15 | 65.54 | 17.77 | 2.34 | — | — | — | |
| PolyhistorBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=8.96 M2025.12 | 70.87 | 59.15 | 65.54 | — | 2.34 | — | 17.77 | — | |
| PolyhistorBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=8.96, Single inference (all tasks)=False2026.03 | 70.87 | 59.54 | 65.47 | 17.47 | 2.34 | — | — | — | |
| PolyhistorBackbone=Swin, Trainable Params (M)=8.962025.09 | 70.87 | 59.15 | 65.54 | 17.77 | 2.34 | — | — | — | |
| TADFormerBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Rank (r)=64, Trainable Parameters (M)=7.38, Single inference (all tasks)=True2026.03 | 70.82 | 60.45 | 65.88 | 16.48 | 4.24 | — | — | — | |
| Single Task – LoRABackbone=Swin, Adapter Modules=attn + mlp, Trainable Params (M)=5.292025.09 | 70.8 | 58.73 | 66.05 | 16.65 | 3.36 | — | — | — | |
| TGLoRABackbone=Swin, Adapter Modules=attn + mlp + others, Trainable Params (M)=6.892025.09 | 70.53 | 60.96 | 66.12 | 16.43 | 4.5 | — | — | — | |
| TGLoRABackbone=Swin, Adapter Modules=attn + mlp, Trainable Params (M)=5.292025.09 | 70.39 | 60.58 | 65.94 | 16.61 | 3.97 | — | — | — | |
| TGLoRABackbone=Swin, Adapter Modules=attn, Trainable Params (M)=3.202025.09 | 70.27 | 59.36 | 65.38 | 17.09 | 2.54 | — | — | — | |
| VL-AdapterProtocol=Adapter-Based, Trainable Swin Parameters (M)=2.80, Single Inference For All Tasks=false2025.02 | 70.21 | 59.15 | 62.29 | 19.26 | -1.83 | — | — | — | |
| VL-AdapterBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=4.74 M2025.12 | 70.21 | 59.15 | 62.29 | — | -1.83 | — | 19.26 | — | |
| VL-AdapterBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=4.74, Single inference (all tasks)=False2026.03 | 70.21 | 59.15 | 62.29 | 19.26 | -1.83 | — | — | — | |
| LoRAProtocol=Fixed-Rank, Trainable Swin Parameters (M)=0.93, Single Inference For All Tasks=false2025.02 | 70.12 | 57.73 | 61.9 | 18.96 | -2.17 | — | — | — | |
| LoRABackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=2.87 M2025.12 | 70.12 | 57.73 | 61.9 | — | -2.17 | — | 18.96 | — | |
| LoRABackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Rank (r)=4, Trainable Parameters (M)=2.87, Single inference (all tasks)=False2026.03 | 70.12 | 57.73 | 61.9 | 18.96 | -2.17 | — | — | — | |
| TSσBNBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Rank (r)=16, Number of trainable parameters (#P)=4.25 M2025.12 | 70 | 58.01 | 63.89 | — | 1.63 | — | 16.85 | — | |
| MTL - DITASKProtocol=Ours, Trainable Swin Parameters (M)=1.61, Single Inference For All Tasks=true, Backbone=Swin-Tiny2025.02 | 69.66 | 62.02 | 65 | 17.1 | 3.22 | — | — | — | |
| DiTASKBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Rank (r)=64, Trainable Parameters (M)=3.55, Single inference (all tasks)=True2026.03 | 69.66 | 62.02 | 65 | 17.1 | 3.22 | — | — | — | |
| TSσBNBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=3.08 M2025.12 | 69.38 | 57.46 | 63.74 | — | 0.91 | — | 17 | — | |
| AdapterProtocol=Adapter-Based, Trainable Swin Parameters (M)=9.26, Single Inference For All Tasks=false2025.02 | 69.21 | 57.38 | 61.28 | 18.83 | -2.71 | — | — | — | |
| AdapterBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=11.24 M2025.12 | 69.21 | 57.38 | 61.28 | — | -2.71 | — | 18.83 | — | |
| AdapterBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=11.24, Single inference (all tasks)=False2026.03 | 69.21 | 57.38 | 61.28 | 18.83 | -2.71 | — | — | — | |
| TSBNBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=3.08 M2025.12 | 69.12 | 57 | 62.76 | — | -0.54 | — | 17.56 | — | |
| MTL - ReFTProtocol=Fixed-Rank, Trainable Swin Parameters (M)=16.16, Single Inference For All Tasks=true2025.02 | 68.75 | 56.49 | 58.76 | 20.54 | -6.63 | — | — | — | |
| BitfitProtocol=Adapter-Based, Trainable Swin Parameters (M)=0.91, Single Inference For All Tasks=false2025.02 | 68.57 | 55.99 | 60.64 | 19.42 | -4.6 | — | — | — | |
| BitFitBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=2.85 M2025.12 | 68.57 | 55.99 | 60.64 | — | -4.6 | — | 19.42 | — | |
| BitfitBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=2.85, Single inference (all tasks)=False2026.03 | 68.57 | 55.99 | 60.64 | 19.42 | -4.6 | — | — | — | |
| MTLoRA+Backbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Rank (r)=8, Number of trainable parameters (#P)=3.15 M2025.12 | 68.54 | 58.3 | 63.57 | — | 0.29 | — | 17.41 | — | |
| MTLORAProtocol=Fixed-Rank, rank (r)=16, Trainable Swin Parameters (M)=3.01, Single Inference For All Tasks=true2025.02 | 68.19 | 58.99 | 64.48 | 17.03 | 1.35 | — | — | — | |
| MTLoRABackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Rank (r)=16, Number of trainable parameters (#P)=4.95 M2025.12 | 68.19 | 58.99 | 64.48 | — | 1.35 | — | 17.03 | — | |
| CompactorProtocol=Adapter-Based, Trainable Swin Parameters (M)=0.84, Single Inference For All Tasks=false2025.02 | 68.08 | 56.41 | 60.08 | 19.22 | -4.55 | — | — | — | |
| CompacterBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=2.78 M2025.12 | 68.08 | 56.41 | 60.08 | — | -4.55 | — | 19.22 | — | |
| Compacter++Backbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=2.66, Single inference (all tasks)=False2026.03 | 68.08 | 55.69 | 59.47 | 19.54 | -5.84 | — | — | — | |
| MTLORAProtocol=Fixed-Rank, rank (r)=64, Trainable Swin Parameters (M)=6.40, Single Inference For All Tasks=true2025.02 | 67.9 | 59.84 | 65.4 | 16.6 | 2.55 | — | — | — | |
| MTLoRABackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Rank (r)=64, Trainable Parameters (M)=8.34, Single inference (all tasks)=True2026.03 | 67.9 | 59.84 | 65.4 | 16.6 | 2.55 | — | — | — | |
| MTLoRABackbone=Swin, Rank (r)=64, Trainable Params (M)=8.342025.09 | 67.9 | 59.84 | 65.4 | 16.6 | 2.55 | — | — | — | |
| MTLORAProtocol=Fixed-Rank, rank (r)=32, Trainable Swin Parameters (M)=4.14, Single Inference For All Tasks=true2025.02 | 67.74 | 59.46 | 64.9 | 16.59 | 2.16 | — | — | — | |
| MTL – LoRABackbone=Swin, Adapter Modules=attn + mlp, Trainable Params (M)=5.292025.09 | 67.57 | 59.09 | 65.18 | 17.08 | 1.36 | — | — | — | |
| MTL - FullProtocol=Full Fine-Tuning, Trainable Swin Parameters (M)=28.12, Single Inference For All Tasks=false2025.02 | 67.56 | 60.24 | 65.21 | 16.64 | 2.23 | — | — | — | |
| MTL-Full FTBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=30.06 M2025.12 | 67.56 | 60.24 | 65.21 | — | 2.23 | — | 16.64 | — | |
| MTL - Full Fine TuningBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=30.06, Single inference (all tasks)=True2026.03 | 67.56 | 60.24 | 65.21 | 16.64 | 2.23 | — | — | — | |
| MTL – Full Fine-TuningBackbone=Swin, Protocol=Full Fine-Tuning, Trainable Params (M)=30.062025.09 | 67.56 | 60.24 | 65.21 | 16.64 | 2.23 | — | — | — | |
| Compactor++Protocol=Adapter-Based, Trainable Swin Parameters (M)=0.72, Single Inference For All Tasks=false2025.02 | 67.26 | 55.69 | 59.47 | 19.54 | -5.84 | — | — | — | |
| Compacter++Backbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=2.66 M2025.12 | 67.26 | 55.69 | 59.47 | — | -5.84 | — | 19.54 | — | |
| CompacterBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=2.78, Single inference (all tasks)=False2026.03 | 67.26 | 56.41 | 60.08 | 19.22 | -4.55 | — | — | — | |
| Single TaskProtocol=Full Fine-Tuning, Trainable Swin Parameters (M)=112.62, Single Inference For All Tasks=false2025.02 | 67.21 | 61.93 | 62.35 | 17.97 | 0 | — | — | — | |
| STLBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=112.62 M2025.12 | 67.21 | 61.93 | 62.35 | — | 0 | — | 17.97 | — | |
| Single TaskBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=112.62, Single inference (all tasks)=False2026.03 | 67.21 | 61.93 | 62.35 | 17.97 | 0 | — | — | — | |
| Single Task – Full Fine-TuningBackbone=Swin, Protocol=Full Fine-Tuning, Trainable Params (M)=112.622025.09 | 67.21 | 61.93 | 62.35 | 17.97 | 0 | — | — | — | |
| MTL - Dec. OnlyProtocol=Full Fine-Tuning, Trainable Swin Parameters (M)=0, Single Inference For All Tasks=true2025.02 | 65.09 | 53.48 | 57.46 | 20.69 | -9.95 | — | — | — | |
| MTL - Tuning Decoders OnlyBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=1.94, Single inference (all tasks)=True2026.03 | 65.09 | 53.48 | 57.46 | 20.69 | -9.95 | — | — | — | |
| MTL – Decoders OnlyBackbone=Swin, Protocol=Decoders Only, Trainable Params (M)=1.942025.09 | 65.09 | 53.48 | 57.46 | 20.69 | 9.95 | — | — | — | |
| MTL - SVFTProtocol=Fixed-Rank, Trainable Swin Parameters (M)=3.83, Single Inference For All Tasks=true2025.02 | 64.44 | 55.94 | 63.03 | 17.86 | -3.02 | — | — | — | |
| VPT-deepProtocol=Adapter-Based, Trainable Swin Parameters (M)=1.49, Single Inference For All Tasks=false2025.02 | 64.35 | 52.54 | 58.15 | 21.07 | -10.85 | — | — | — | |
| VPT-deepBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=3.43 M2025.12 | 64.35 | 52.54 | 58.15 | — | -10.85 | — | 21.07 | — | |
| VPT-deepBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=3.43, Single inference (all tasks)=False2026.03 | 64.35 | 52.54 | 58.15 | 21.07 | -10.85 | — | — | — | |
| VPT-shallowProtocol=Adapter-Based, Trainable Swin Parameters (M)=0.63, Single Inference For All Tasks=false2025.02 | 62.96 | 52.27 | 58.31 | 20.9 | -11.18 | — | — | — | |
| VPT-shallowBackbone=Swin-T, Evaluation Protocol=Parameter-Efficient Fine-Tuning (PEFT), Number of trainable parameters (#P)=2.57 M2025.12 | 62.96 | 52.27 | 58.31 | — | -11.18 | — | 20.9 | — | |
| VPT-shallowBackbone=Swin-Tiny, Pre-trained=ImageNet-1k, Trainable Parameters (M)=2.57, Single inference (all tasks)=False2026.03 | 62.96 | 52.27 | 58.31 | 20.9 | -11.18 | — | — | — | |
| MTL - DoRAProtocol=Fixed-Rank, Trainable Swin Parameters (M)=6.40, Single Inference For All Tasks=true2025.02 | 52.36 | 50.82 | 63.53 | 18.32 | -10.02 | — | — | — |