Semantic Segmentation on ADE20K 70 (val)
59.4mIoUMask2Former
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mask2FormerBackbone=ViT-L [23], Pre-training=DINOv2 + DA, Input size=896x8962025.03 | 59.4 | — | — | |
| Mask2FormerBackbone=ViT-L [17], Pre-training=DINOv2 + DA [62], Input size=896²2026.07 | 59.4 | — | — | |
| Mask2FormerBackbone=ViT-Adapter-L [13], Pre-training=DINOv2, Params=351M, Input size=512x512, GFLOPs=910, FPS=21, re-implementation=true2025.03 | 58.9 | — | — | |
| Mask2FormerBackbone=ViT-Adapter-L [10], Pre-training=DINOv2, Params=351M, Input size=512²2026.07 | 58.9 | 910 | 21 | |
| LUMABackbone=ViT-L [17], Pre-training=DINOv2, Params=320M, Input size=512²2026.07 | 58.7 | 719 | 154 | |
| EoMTBackbone=ViT-L [23], Pre-training=DINOv2, Params=319M, Input size=512x512, GFLOPs=721, FPS=922025.03 | 58.4 | — | — | |
| EoMT‡Backbone=ViT-L [17], Pre-training=DINOv2, Params=319M, Input size=512²2026.07 | 58.4 | 721 | 150 | |
| OneFormerBackbone=DiNAT-L [30], Pre-training=IN21K, Params=223M, Input size=896x896, GFLOPs=678, FPS=192025.03 | 58.1 | — | — | |
| OneFormer†Backbone=DiNAT-L [22], Pre-training=IN21K, Params=223M, Input size=896²2026.07 | 58.1 | 678 | 19 | |
| OneFormerBackbone=ConvNext-XL [46], Pre-training=IN21K, Params=373M, Input size=640x640, GFLOPs=607, FPS=212025.03 | 57.4 | — | — | |
| OneFormer†Backbone=ConvNext-XL [38], Pre-training=IN21K, Params=373M, Input size=640²2026.07 | 57.4 | 607 | 21 | |
| MaskDINOBackbone=Swin-L [45], Pre-training=IN21K, Params=223M, Input size=640x6402025.03 | 56.6 | — | — | |
| MaskDINO†Backbone=Swin-L [37], Pre-training=IN21K, Params=223M, Input size=640²2026.07 | 56.6 | — | — | |
| Mask2FormerBackbone=Swin-L [45], Pre-training=IN21K, Params=216M, Input size=640x640, FPS=332025.03 | 56.1 | — | — | |
| Mask2Former†Backbone=Swin-L [37], Pre-training=IN21K, Params=216M, Input size=640²2026.07 | 56.1 | — | 33 |