Semantic Segmentation on A-150 (test)
31.6mIoUSED
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SEDModel scale=Base2023.11 | 31.6 | 82 | |
| SED-fastModel scale=Base2023.11 | 29.4 | 32 | |
| SANModel scale=Base2023.11 | 27.5 | 32 | |
| CAT-SegModel scale=Base2023.11 | 27.2 | 362 | |
| OVSegModel scale=Base2023.11 | 24.8 | 314 | |
| SimBaselineModel scale=Base2023.11 | 20.5 | 316 | |
| PixelCLIPTraining Dataset=5% SA-1B [13] (0.5M), Backbone=ConvNeXt-B, Additional Labels=-, VFM=CLIP, SAM2024.09 | 20.3 | — | |
| PixelCLIPTraining Dataset=5% SA-1B [13] (0.5M), Backbone=ConvNeXt-B, Additional Labels=-, VFM=CLIP, DINO2024.09 | 19.4 | — | |
| ZeroSegTraining Dataset=ImageNet-1K [61], Backbone=ViT-B/16, Additional Labels=-, VFM=CLIP, SAM2024.09 | 18.7 | — | |
| ZeroSegTraining Dataset=ImageNet-1K [61], Backbone=ViT-B/16, Additional Labels=-, VFM=CLIP, DINO2024.09 | 17.4 | — | |
| SAM-CLIPTraining Dataset=Merged-41M [10], Backbone=ViT-B/16, Additional Labels=Captions, VFM=CLIP, SAM2024.09 | 17.1 | — | |
| TCLTraining Dataset=CC3M, CC12M [56], Backbone=ViT-B/16, Additional Labels=Captions, VFM=CLIP2024.09 | 14.9 | — | |
| CLIPpyTraining Dataset=HQITP-134M [25], Backbone=ViT-B/16, Additional Labels=-, VFM=-2024.09 | 13.5 | — | |
| CLIPTraining Dataset=WIT-400M [15], Backbone=ViT-B/16, Additional Labels=-, VFM=-2024.09 | 13.2 | — | |
| OpenCLIPTraining Dataset=LAION-2B [59], Backbone=ConvNeXt-B, Additional Labels=-, VFM=-2024.09 | 13.1 | — | |
| GroupViTTraining Dataset=CC12M [56], YFCC15M [57], Backbone=ViT-S/16, Additional Labels=-, VFM=-2024.09 | 9.2 | — |