Semantic Segmentation on ADE20K 83 (val)
54.7mIoUVAN-B6
Evaluation Results
| Method | Links | |
|---|---|---|
| VAN-B6Params (M)=231, Input size=512x512, GFLOPs=1658, Pre-trained=ImageNet-22K2022.02 | 54.7 | |
| VAN-B5Params (M)=117, Input size=512x512, GFLOPs=1208, Pre-trained=ImageNet-22K2022.02 | 53.9 | |
| ConvNeXt-LParams (M)=235, Input size=640x640, GFLOPs=2458, Pre-trained=ImageNet-22K2022.02 | 53.7 | |
| Swin-LParams (M)=234, Input size=640x640, GFLOPs=2468, Pre-trained=ImageNet-22K2022.02 | 53.5 | |
| ConvNeXt-BParams (M)=122, Input size=640x640, GFLOPs=1828, Pre-trained=ImageNet-22K2022.02 | 53.1 | |
| UperNetBackbone=VAN-B4, Parameters (M)=90, GFLOPs=1098, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 52.2 | |
| Swin-BParams (M)=121, Input size=640x640, GFLOPs=1841, Pre-trained=ImageNet-22K2022.02 | 51.7 | |
| UperNetBackbone=VAN-B3, Parameters (M)=75, GFLOPs=1030, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 50.6 | |
| UperNetBackbone=VAN-B2, Parameters (M)=57, GFLOPs=948, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 50.1 | |
| UperNetBackbone=ConvNeXt-B, Parameters (M)=122, GFLOPs=1170, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 49.9 | |
| UperNetBackbone=Swin-B, Parameters (M)=121, GFLOPs=1188, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 49.7 | |
| UperNetBackbone=ConvNeXt-S, Parameters (M)=82, GFLOPs=1027, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 49.5 | |
| DaViT-BaseBackbone=DaViT-Base, Segmentation Method=UperNet, #Params (M)=121, FLOPs (G)=1175, Evaluation Strategy=Single-scale2022.04 | 49.4 | |
| UperNetBackbone=Swin-S, Parameters (M)=81, GFLOPs=1038, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 49.3 | |
| ViT-HybridBackbone=ViT-Hybrid, Segmentation Method=DPT, #Params (M)=124, FLOPs (G)=1231, Evaluation Strategy=Single-scale2022.04 | 49 | |
| Focal-BaseBackbone=Focal-Base, Segmentation Method=UperNet, #Params (M)=126, FLOPs (G)=1354, Evaluation Strategy=Single-scale2022.04 | 49 | |
| DaViT-SmallBackbone=DaViT-Small, Segmentation Method=UperNet, #Params (M)=81, FLOPs (G)=1030, Evaluation Strategy=Single-scale2022.04 | 48.8 | |
| Twins-SVT-LargeBackbone=Twins-SVT-Large, Segmentation Method=UperNet, #Params (M)=133, FLOPs (G)=1188, Evaluation Strategy=Single-scale2022.04 | 48.8 | |
| ResNeSt-200Backbone=ResNeSt-200, Segmentation Method=DLab.v3+, #Params (M)=88, FLOPs (G)=1381, Evaluation Strategy=Single-scale2022.04 | 48.4 | |
| XCiT-M24/8Backbone=XCiT-M24/8, Segmentation Method=UperNet, #Params (M)=109, Evaluation Strategy=Single-scale2022.04 | 48.4 | |
| Swin-BaseBackbone=Swin-Base, Segmentation Method=UperNet, #Params (M)=121, FLOPs (G)=1188, Evaluation Strategy=Single-scale2022.04 | 48.1 | |
| Semantic FPNBackbone=VAN-B3, Parameters (M)=49, GFLOPs=68, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 48.1 | |
| Focal-SmallBackbone=Focal-Small, Segmentation Method=UperNet, #Params (M)=85, FLOPs (G)=1130, Evaluation Strategy=Single-scale2022.04 | 48 | |
| Twins-SVT-BaseBackbone=Twins-SVT-Base, Segmentation Method=UperNet, #Params (M)=88, FLOPs (G)=1044, Evaluation Strategy=Single-scale2022.04 | 47.7 | |
| Swin-SmallBackbone=Swin-Small, Segmentation Method=UperNet, #Params (M)=81, FLOPs (G)=1038, Evaluation Strategy=Single-scale2022.04 | 47.6 | |
| Semantic FPNBackbone=PVTv2-B3, Parameters (M)=49, GFLOPs=62, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 47.3 | |
| XCiT-S24/16Backbone=XCiT-S24/16, Segmentation Method=UperNet, #Params (M)=73, Evaluation Strategy=Single-scale2022.04 | 46.9 | |
| HamNetBackbone=ResNet-101, Parameters (M)=69, GFLOPs=1111, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 46.8 | |
| Semantic FPNBackbone=VAN-B2, Parameters (M)=30, GFLOPs=48, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 46.7 | |
| UperNetBackbone=ConvNeXt-T, Parameters (M)=60, GFLOPs=939, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 46.7 | |
| DaViT-TinyBackbone=DaViT-Tiny, Segmentation Method=UperNet, #Params (M)=60, FLOPs (G)=940, Evaluation Strategy=Single-scale2022.04 | 46.3 | |
| Twins-SVT-SmallBackbone=Twins-SVT-Small, Segmentation Method=UperNet, #Params (M)=54, FLOPs (G)=912, Evaluation Strategy=Single-scale2022.04 | 46.2 | |
| UperNetBackbone=Swin-T, Parameters (M)=60, GFLOPs=945, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 46.1 | |
| XCiT-S12/16Backbone=XCiT-S12/16, Segmentation Method=UperNet, #Params (M)=52, Evaluation Strategy=Single-scale2022.04 | 45.9 | |
| Focal-TinyBackbone=Focal-Tiny, Segmentation Method=UperNet, #Params (M)=62, FLOPs (G)=998, Evaluation Strategy=Single-scale2022.04 | 45.8 | |
| HRNet-w48Backbone=HRNet-w48, Segmentation Method=OCRNet, #Params (M)=71, FLOPs (G)=664, Evaluation Strategy=Single-scale2022.04 | 45.7 | |
| OCRNetBackbone=ResNet-101, Parameters (M)=56, GFLOPs=923, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 45.3 | |
| Semantic FPNBackbone=PVTv2-B2, Parameters (M)=29, GFLOPs=46, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 45.2 | |
| ResNet-101Backbone=ResNet-101, Segmentation Method=UperNet, #Params (M)=86, FLOPs (G)=1029, Evaluation Strategy=Single-scale2022.04 | 44.9 | |
| UperNetBackbone=ResNet-101, Parameters (M)=86, GFLOPs=1029, Training Scheme=Following [15], Input Resolution=2048x5122022.02 | 44.9 | |
| PVT-LargeBackbone=PVT-Large, Segmentation Method=SemanticFPN, #Params (M)=65, FLOPs (G)=318, Evaluation Strategy=Single-scale2022.04 | 44.8 | |
| Swin-TinyBackbone=Swin-Tiny, Segmentation Method=UperNet, #Params (M)=60, FLOPs (G)=945, Evaluation Strategy=Single-scale2022.04 | 44.5 | |
| Semantic FPNBackbone=PVT-Medium, Parameters (M)=48, GFLOPs=61, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 43.5 | |
| Semantic FPNBackbone=VAN-B1, Parameters (M)=18, GFLOPs=35, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 42.9 | |
| Semantic FPNBackbone=PVTv2-B1, Parameters (M)=18, GFLOPs=34, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 42.5 | |
| Semantic FPNBackbone=PoolFormer-S36, Parameters (M)=35, GFLOPs=48, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 42 | |
| Semantic FPNBackbone=PoolFormer-S24, Parameters (M)=23, GFLOPs=39, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 40.3 | |
| Semantic FPNBackbone=PVT-Small, Parameters (M)=28, GFLOPs=45, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 39.8 | |
| Semantic FPNBackbone=ResNeXt101-32x4d, Parameters (M)=47, GFLOPs=65, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 39.7 | |
| Semantic FPNBackbone=ResNet101, Parameters (M)=48, GFLOPs=65, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 38.8 | |
| Semantic FPNBackbone=VAN-B0, Parameters (M)=8, GFLOPs=26, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 38.5 | |
| Semantic FPNBackbone=PVTv2-B0, Parameters (M)=8, GFLOPs=25, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 37.2 | |
| Semantic FPNBackbone=PoolFormer-S12, Parameters (M)=16, GFLOPs=31, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 37.2 | |
| Semantic FPNBackbone=ResNet50, Parameters (M)=29, GFLOPs=46, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 36.7 | |
| Semantic FPNBackbone=PVT-Tiny, Parameters (M)=17, GFLOPs=33, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 35.7 | |
| Semantic FPNBackbone=ResNet18, Parameters (M)=16, GFLOPs=32, Training Scheme=Following [98], Input Resolution=512x5122022.02 | 32.9 |