Semantic Segmentation on NYUD v2
65.6mIoUM2H-MX-L
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| M2H-MX-Lvariant=L2026.03 | 65.6 | — | — | — | |
| M2H-MXVariant=Large2026.05 | 65.6 | — | — | — | |
| DINOv2Backbone=ViT-g/14, Frozen Backbone=true2024.12 | 63.89 | — | — | — | |
| RADIOv2.5Backbone=ViT-H/16, Frozen Backbone=true2024.12 | 63.82 | — | — | — | |
| TIGER-LBackbone=ViT-L2026.06 | 63.55 | — | — | — | |
| SAKCategory=Conventional Multi-task Methods2026.06 | 63.18 | — | — | — | |
| DINOv2Backbone=ViT-L/14, Frozen Backbone=true2024.12 | 62.94 | — | — | — | |
| AM-RADIOBackbone=ViT-H/16, Frozen Backbone=true2024.12 | 62.76 | — | — | — | |
| M2H-MX-Bvariant=B2026.03 | 61.8 | — | — | — | |
| M2H-MXVariant=Base2026.05 | 61.8 | — | — | — | |
| M2H2026.03 | 61.54 | — | — | — | |
| M2H2026.05 | 61.54 | — | — | — | |
| RADIOv2.5Backbone=ViT-L/16, Frozen Backbone=true2024.12 | 61.42 | — | — | — | |
| TIGER-BBackbone=ViT-B2026.06 | 60.71 | — | — | — | |
| DINOv2Backbone=ViT-B/16, Frozen Backbone=true2024.12 | 60.64 | — | — | — | |
| UNICBackbone=ViT-L/14, Frozen Backbone=true2024.12 | 58.56 | — | — | — | |
| DINOv2-ViT-LBackbone=ViT-L2026.06 | 58.44 | — | — | — | |
| SwinMTL2026.03 | 58.14 | — | — | — | |
| SwinMTL2026.05 | 58.14 | — | — | — | |
| B^3-NetDecoder Type=Bridge-feature-based decoder2026.05 | 57.78 | — | — | — | |
| UV-M3TLBackbone=ViT-large2026.02 | 57.37 | — | — | — | |
| MTLSI-NetBackbone=Swin-L, Params(M)=38.272026.04 | 57.22 | — | — | — | |
| RADIOv2.5Backbone=ViT-B/16, Frozen Backbone=true2024.12 | 57.19 | — | — | — | |
| MTMamba++Backbone=Swin-Large, Decoder Pattern=Mamba-based decoder2026.02 | 57.01 | — | — | — | |
| MTMamba++2026.03 | 57.01 | — | — | — | |
| MTMamba++Decoder Type=Mamba-based decoder2026.05 | 57.01 | — | — | — | |
| MTMamba++2026.05 | 57.01 | — | — | — | |
| SEMCategory=Conventional Multi-task Methods2026.06 | 56.82 | — | — | — | |
| TIFBackbone=Swin-L, Params(M)=32.912026.04 | 56.8 | — | — | — | |
| BridgeNetDecoder Type=Bridge-feature-based decoder2026.05 | 56.57 | — | — | — | |
| MLOREBackbone=ViT-large2024.03 | 55.96 | — | — | — | |
| MLoREBackbone=ViT-large, Decoder Pattern=Transformer-based decoder2026.02 | 55.96 | — | — | — | |
| MLoREBackbone=Custom, Frozen Backbone=true2024.12 | 55.96 | — | — | — | |
| MLoRE2026.03 | 55.96 | — | — | — | |
| MLoREDecoder Type=Transformer-based decoder2026.05 | 55.96 | — | — | — | |
| MLoRE2026.05 | 55.96 | — | — | — | |
| MLoRECategory=Conventional Multi-task Methods2026.06 | 55.96 | — | — | — | |
| MTMambaBackbone=Swin-Large, Decoder Pattern=Mamba-based decoder2026.02 | 55.82 | — | — | — | |
| MTMamba2026.03 | 55.82 | — | — | — | |
| MTMambaDecoder Type=Mamba-based decoder2026.05 | 55.82 | — | — | — | |
| MTMamba2026.05 | 55.82 | — | — | — | |
| MTMambaCategory=Conventional Multi-task Methods2026.06 | 55.82 | — | — | — | |
| TaskDiffusionBackbone=ViT-large, Decoder Pattern=Diffusion-based decoder2026.02 | 55.65 | — | — | — | |
| TaskDiffusionDecoder Type=Diffusion-based decoder2026.05 | 55.65 | — | — | — | |
| TSP-TransformerBackbone=ViT-large, Decoder Pattern=Transformer-based decoder2026.02 | 55.39 | — | — | — | |
| TSP-TransformerDecoder Type=Transformer-based decoder2026.05 | 55.39 | — | — | — | |
| TaskExpertBackbone=ViT-large2024.03 | 55.35 | — | — | — | |
| TaskExpertBackbone=ViT-large, Decoder Pattern=Transformer-based decoder2026.02 | 55.35 | — | — | — | |
| TaskExpertBackbone=ViT-L2026.04 | 55.35 | — | — | — | |
| TaskExpertCategory=Conventional Multi-task Methods2026.06 | 55.35 | — | — | — | |
| TaskPrompterBackbone=ViT-large2024.03 | 55.3 | — | — | — | |
| TaskPrompterBackbone=ViT-large, Decoder Pattern=Transformer-based decoder2026.02 | 55.3 | — | — | — | |
| TaskPrompter2026.03 | 55.3 | — | — | — | |
| TaskPrompterBackbone=ViT-L, Params(M)=88.002026.04 | 55.3 | — | — | — | |
| TaskPrompterDecoder Type=Transformer-based decoder2026.05 | 55.3 | — | — | — | |
| TaskPrompter2026.05 | 55.3 | — | — | — | |
| TaskPrompterCategory=Conventional Multi-task Methods2026.06 | 55.3 | — | — | — | |
| RADIOCategory=Conventional Multi-task Methods2026.06 | 55.03 | — | — | — | |
| InvPT-B|MTPD-C2026.03 | 54.86 | — | — | — | |
| MQTransformerBackbone=ViT-large, Decoder Pattern=Transformer-based decoder2026.02 | 54.84 | — | — | — | |
| MQTransformer2026.03 | 54.84 | — | — | — | |
| MQTransformerDecoder Type=Transformer-based decoder2026.05 | 54.84 | — | — | — | |
| MQTransformerCategory=Conventional Multi-task Methods2026.06 | 54.84 | — | — | — | |
| TokenFusionInputs=RGB+D, Variant=S2022.04 | 54.2 | 79 | 66.9 | — | |
| InvPT++Backbone=ViT-large, Decoder Pattern=Transformer-based decoder2026.02 | 53.85 | — | — | — | |
| InvPT++Decoder Type=Transformer-based decoder2026.05 | 53.85 | — | — | — | |
| InvPTBackbone=ViT-large2024.03 | 53.56 | — | — | — | |
| InvPTBackbone=ViT-large, Decoder Pattern=Transformer-based decoder2026.02 | 53.56 | — | — | — | |
| InvPTBackbone=ViT-L, Params(M)=97.962026.04 | 53.56 | — | — | — | |
| InvPTDecoder Type=Transformer-based decoder2026.05 | 53.56 | — | — | — | |
| InvPTCategory=Conventional Multi-task Methods2026.06 | 53.56 | — | — | — | |
| TokenFusionInputs=RGB+D, Variant=Ti2022.04 | 53.3 | 78.6 | 66.2 | — | |
| CENInputs=RGB+D2022.04 | 52.5 | 77.7 | 65 | — | |
| MIPANetModel=ResNet50, Backbone=2 x R502023.11 | 51.9 | 77.2 | — | — | |
| ConcatInputs=RGB+D, Variant=S2022.04 | 51.4 | 77.1 | 63.8 | — | |
| IEMNetModel=ResNet34, Backbone=Res34NBt1D2023.11 | 51.3 | 76.8 | — | — | |
| ShapeConvModel=ResNet101, Backbone=R1012023.11 | 51.3 | 76.4 | — | — | |
| AsymFusionInputs=RGB+D2022.04 | 51.2 | 77 | 64 | — | |
| DynMMModel=ResNet50, Backbone=R502023.11 | 51 | — | — | — | |
| ConcatInputs=RGB+D, Variant=Ti2022.04 | 50.8 | 76.5 | 63.4 | — | |
| w/o fusionInputs=RGB, Variant=S2022.04 | 50.6 | 76 | 63 | — | |
| ESANetModel=ResNet50, Backbone=2 x R502023.11 | 50.5 | — | — | — | |
| PAP-Net2020.01 | 50.4 | 76.2 | 62.5 | — | |
| SA-GateModel=ResNet50, Backbone=2 x R502023.11 | 50.4 | — | — | — | |
| PAD-Net2020.01 | 50.2 | 75.2 | 62.3 | — | |
| RDFNetInputs=RGB+D2022.04 | 50.1 | 76 | 62.8 | — | |
| w/o fusionInputs=RGB, Variant=Ti2022.04 | 49.7 | 75.2 | 62.5 | — | |
| SGNetModel=ResNet101, Backbone=R1012023.11 | 49.6 | 75.6 | — | — | |
| RDFNetModel=ResNet101, Backbone=2 x R1012023.11 | 49.1 | 75.6 | — | — | |
| MTI-NetBackbone=HRNet48-V2, Learning Protocol=Multi-Task2020.01 | 49 | 75.3 | 62.9 | — | |
| SSMAInputs=RGB+D2022.04 | 48.7 | 75.2 | 60.5 | — | |
| ACNetModel=ResNet50, Backbone=3 x R502023.11 | 48.3 | — | — | — | |
| ESANetModel=ResNet18, Backbone=2 x R182023.11 | 48.2 | — | — | — | |
| RDFNetModel=ResNet50, Backbone=2 x R502023.11 | 47.7 | 74.8 | — | — | |
| RefineNetInputs=RGB2022.04 | 47.6 | 74.4 | 59.6 | — | |
| CLIP-ViT-LBackbone=ViT-L2026.06 | 47.43 | — | — | — | |
| BaselineModel=ResNet50, Backbone=2 x R502023.11 | 47.4 | 75.1 | — | — | |
| RedNetModel=ResNet50, Backbone=2 x R502023.11 | 47.2 | — | — | — | |
| DiffusionMTLCategory=Conventional Multi-task Methods2026.06 | 46.82 | — | — | — | |
| MTLSI-NetBackbone=Swin-T, Params(M)=17.452026.04 | 46.79 | — | — | — |