Semantic Segmentation on COCO-St. (test)
45.4mIoUCAA
Evaluation Results
| Method | Links | |
|---|---|---|
| CAABackbone=EfficientNet-B7, Multi-scale prediction=true2021.01 | 45.4 | |
| HRNetV2 + OCR + RMIBackbone=HRNetV2, Multi-scale prediction=true2021.01 | 45.2 | |
| DRANMulti-scale prediction=true2021.01 | 41.2 | |
| HRNetV2 + OCRBackbone=HRNetV2, Multi-scale prediction=true2021.01 | 40.5 | |
| SegCLIPTraining Dataset=COCO [60], CC12M [56], Backbone=ViT-B/16, Additional Labels=Captions, VFM=CLIP2024.09 | 26.5 | |
| ZeroSegTraining Dataset=ImageNet-1K [61], Backbone=ViT-B/16, Additional Labels=-, VFM=CLIP, SAM2024.09 | 23.6 | |
| ZeroSegTraining Dataset=ImageNet-1K [61], Backbone=ViT-B/16, Additional Labels=-, VFM=CLIP, DINO2024.09 | 22.2 | |
| PixelCLIPTraining Dataset=5% SA-1B [13] (0.5M), Backbone=ConvNeXt-B, Additional Labels=-, VFM=CLIP, SAM2024.09 | 21.4 | |
| ZeroSegTraining Dataset=ImageNet-1K [61], Backbone=ViT-B/16, Additional Labels=-, VFM=CLIP2024.09 | 20.2 | |
| PixelCLIPTraining Dataset=5% SA-1B [13] (0.5M), Backbone=ConvNeXt-B, Additional Labels=-, VFM=CLIP, DINO2024.09 | 20.2 | |
| TCLTraining Dataset=CC3M, CC12M [56], Backbone=ViT-B/16, Additional Labels=Captions, VFM=CLIP2024.09 | 19.6 | |
| CLIPTraining Dataset=WIT-400M [15], Backbone=ViT-B/16, Additional Labels=-, VFM=-2024.09 | 16.5 | |
| GroupViTTraining Dataset=CC12M [56], YFCC15M [57], Backbone=ViT-S/16, Additional Labels=-, VFM=-2024.09 | 15.3 | |
| OpenCLIPTraining Dataset=LAION-2B [59], Backbone=ConvNeXt-B, Additional Labels=-, VFM=-2024.09 | 12.8 |