Semantic Segmentation on COCOStuff 164k (val)
48.8mIoUSegMAN-L
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SegMAN-LParams(M)=92.4, GFLOP=97.1, Resolution=512x5122024.12 | 48.8 | — | — | — | |
| SegMAN-BParams(M)=51.8, GFLOP=58.1, Resolution=512x5122024.12 | 48.4 | — | — | — | |
| VWFormer-B5Params(M)=84.6, GFLOP=96.1, Resolution=512x5122024.12 | 48 | — | — | — | |
| SegMAN-SParams(M)=29.4, GFLOP=25.3, Resolution=512x5122024.12 | 47.5 | — | — | — | |
| Segmenter-LBackbone=Segmenter-L, Calibration=Uncalibrated2022.12 | 47.09 | — | — | 0.152 | |
| Segmenter-L (Selective Scaling)Backbone=Segmenter-L, Calibration=Selective Scaling2022.12 | 47.09 | — | — | 0.109 | |
| VWFormer-B3Params(M)=47.3, GFLOP=63.3, Resolution=512x5122024.12 | 46.8 | — | — | — | |
| Segformer-B5Params(M)=84.7, GFLOP=110.3, Resolution=512x5122024.12 | 46.7 | — | — | — | |
| SegNeXt-LParams(M)=48.9, GFLOP=70.0, Resolution=512x5122024.12 | 46.5 | — | — | — | |
| Knet-SWIN-LBackbone=Knet-SWIN-L, Calibration=Uncalibrated2022.12 | 46.49 | — | — | 0.161 | |
| Knet-SWIN-L (Selective Scaling)Backbone=Knet-SWIN-L, Calibration=Selective Scaling2022.12 | 46.49 | — | — | 0.102 | |
| ConvNeXt-LBackbone=ConvNeXt-L, Calibration=Uncalibrated2022.12 | 46.48 | — | — | 0.16 | |
| ConvNeXt-L (Selective Scaling)Backbone=ConvNeXt-L, Calibration=Selective Scaling2022.12 | 46.48 | — | — | 0.108 | |
| EDAFormer-BParams(M)=29.4, GFLOP=32.1, Resolution=512x5122024.12 | 45.9 | — | — | — | |
| SegNeXt-BParams(M)=27.6, GFLOP=34.9, Resolution=512x5122024.12 | 45.8 | — | — | — | |
| SegFormer-B5Backbone=SegFormer-B5, Calibration=Uncalibrated2022.12 | 45.78 | — | — | 0.151 | |
| SegFormer-B5 (Selective Scaling)Backbone=SegFormer-B5, Calibration=Selective Scaling2022.12 | 45.78 | — | — | 0.113 | |
| Segformer-B3Params(M)=47.3, GFLOP=79.0, Resolution=512x5122024.12 | 45.5 | — | — | — | |
| FeedFormer-B2Params(M)=29.1, GFLOP=42.7, Resolution=512x5122024.12 | 45.2 | — | — | — | |
| VWFormer-B2Params(M)=27.4, GFLOP=46.6, Resolution=512x5122024.12 | 45.2 | — | — | — | |
| CGRSeg-T†Params(M)=35.7, GFLOP=16.5, Resolution=512x5122024.12 | 45.2 | — | — | — | |
| Segformer-B2Params(M)=27.5, GFLOP=62.4, Resolution=512x5122024.12 | 44.6 | — | — | — | |
| SegMAN-TParams(M)=6.4, GFLOP=6.2, Resolution=512x5122024.12 | 41.3 | — | — | — | |
| CSAP-TParams (M)=4.8, GFLOPs=5.52026.04 | 40.9 | — | — | — | |
| CGRSeg-T†Params(M)=9.4, GFLOP=4.8, Resolution=512x5122024.12 | 40.4 | — | — | — | |
| EDAFormer-TParams(M)=4.9, GFLOP=5.8, Resolution=512x5122024.12 | 40.3 | — | — | — | |
| EDAFormer-TParams (M)=4.9, GFLOPs=5.62026.04 | 40.3 | — | — | — | |
| MetaSeg-TParams (M)=4.7, GFLOPs=5.52026.04 | 39.7 | — | — | — | |
| SegNeXt-TParams (M)=4.3, GFLOPs=6.62026.04 | 38.8 | — | — | — | |
| SegNeXt-TParams(M)=4.3, GFLOP=7.7, Resolution=512x5122024.12 | 38.7 | — | — | — | |
| Knet-DeepLabBackbone=Knet-DeepLab, Calibration=Uncalibrated2022.12 | 37.24 | — | — | 0.17 | |
| Knet-DeepLab (Selective Scaling)Backbone=Knet-DeepLab, Calibration=Selective Scaling2022.12 | 37.24 | — | — | 0.093 | |
| VWFormer-B0Params(M)=3.7, GFLOP=5.8, Resolution=512x5122024.12 | 36.2 | — | — | — | |
| VWFormer-B0Params (M)=3.7, GFLOPs=5.12026.04 | 36.2 | — | — | — | |
| Segformer-B0Params(M)=3.8, GFLOP=8.4, Resolution=512x5122024.12 | 35.6 | — | — | — | |
| SegFormer-B0Params (M)=3.8, GFLOPs=8.42026.04 | 35.6 | — | — | — | |
| OTSegSource Dataset=Context-49, Evaluation Setting=Transductive2024.03 | 18.9 | — | — | — | |
| ZegCLIPSource Dataset=Context-49, Evaluation Setting=Transductive2024.03 | 18.1 | — | — | — | |
| OTSeg+Source Dataset=Context-49, Evaluation Setting=Transductive2024.03 | 18.1 | — | — | — | |
| OTSeg+Source Dataset=Context-49, Evaluation Setting=Inductive2024.03 | 16.8 | — | — | — | |
| OTSegSource Dataset=Context-49, Evaluation Setting=Inductive2024.03 | 16.7 | — | — | — | |
| ZegCLIPSource Dataset=Context-49, Evaluation Setting=Inductive2024.03 | 15.6 | — | — | — | |
| SAIL (NV2)Data (Pre-training source)=23M Merged, Backbone=ViT-L/14, Text Encoder=NV22024.12 | 14.7 | — | — | — | |
| SAIL (GTE)Data (Pre-training source)=23M Merged, Backbone=ViT-L/14, Text Encoder=GTE2024.12 | 14.1 | — | — | — | |
| SCLIPData (Pre-training source)=LAION400M, Backbone=ViT-L/142024.12 | 13.1 | — | — | — | |
| MaskCLIPData (Pre-training source)=LAION400M, Backbone=ViT-L/142024.12 | 8.9 | — | — | — | |
| CLIPData (Pre-training source)=LAION400M, Backbone=ViT-L/142024.12 | 2.4 | — | — | — | |
| ALGMBackbone=ViT-L, Avenue=CVPR'242025.02 | — | — | 47.4 | — | |
| CAABackbone=EfficientNet-B5, Avenue=AAAI'222025.02 | — | — | 47.3 | — | |
| CARTBackbone=EfficientNet-L2, Avenue=TCSVT'242025.02 | — | 50.2 | 50.9 | — | |
| EVAcrop size=896^22022.11 | — | 53.4 | — | — | |
| HFGDBackbone=ConvNeXt-L, Avenue=TCSVT'242025.02 | — | 49 | 49.4 | — | |
| InternImageBackbone=InternImage-H, Avenue=CVPR'232025.02 | — | 52.6 | — | — | |
| OCRBackbone=HRFormer-B, Avenue=NIPS'212025.02 | — | — | 43.3 | — | |
| RankSegBackbone=ViT-L, Avenue=ECCV'222025.02 | — | 46.7 | 47.9 | — | |
| SegFormerBackbone=MiT-B5, Avenue=NIPS'212025.02 | — | — | 46.7 | — | |
| SegNeXtBackbone=MSCAN-L, Avenue=NIPS'222025.02 | — | 46.5 | 47.2 | — | |
| ViT-AdapterBackbone=ViT-L, Avenue=ICLR'232025.02 | — | — | 52 | — | |
| ViT-Adaptercrop size=896^22022.11 | — | 52.3 | — | — | |
| VPNeXtBackbone=ViT-L2025.02 | — | 53 | 53.7 | — |