Semantic Segmentation on ADE20K 2016 (val)
59.5mIoUEoMT
Evaluation Results
| Method | Links | |
|---|---|---|
| EoMTBackbone=ViT-L, Pre-training=DINOv3, Encoder=Finetuned, Input size=512², Params=315M, GFLOPs=721, FPS=1512026.03 | 59.5 | |
| Mask2FormerBackbone=ViT-Adapter-L, Pre-training=DINOv3, Encoder=Frozen, Input size=512², Params=340M, GFLOPs=879, FPS=402026.03 | 58.7 | |
| PMTBackbone=ViT-L, Pre-training=DINOv3, Encoder=Frozen, Input size=512², Params=357M, GFLOPs=823, FPS=1282026.03 | 58.5 | |
| EoMTBackbone=ViT-L, Pre-training=DINOv2, Encoder=Finetuned, Input size=512², Params=316M, GFLOPs=721, FPS=1542026.03 | 58.4 | |
| OneFormer†Backbone=DiNAT-L, Pre-training=IN21K, Encoder=Finetuned, Input size=896², Params=223M, GFLOPs=678, FPS=192026.03 | 58.1 | |
| Mask2FormerBackbone=ViT-Adapter-L, Pre-training=DINOv2, Encoder=Frozen, Input size=512², Params=341M, GFLOPs=879, FPS=412026.03 | 57.5 | |
| OneFormer†Backbone=ConvNext-XL, Pre-training=IN21K, Encoder=Finetuned, Input size=640², Params=373M, GFLOPs=607, FPS=212026.03 | 57.4 | |
| PMTBackbone=ViT-L, Pre-training=DINOv2, Encoder=Frozen, Input size=512², Params=358M, GFLOPs=823, FPS=1352026.03 | 57.2 | |
| MaskDINO†Backbone=Swin-L, Pre-training=IN21K, Encoder=Finetuned, Input size=640², Params=223M2026.03 | 56.6 | |
| Mask2Former†Backbone=Swin-L, Pre-training=IN21K, Encoder=Finetuned, Input size=640², Params=216M, FPS=332026.03 | 56.1 |