Unsupervised Semantic Segmentation on PASCAL VOC 2012 (val)
38.4mIoUxCLIP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| xCLIPData=IT35M, Backbone=ViT-S, Framework=GroupViT2022.10 | 38.4 | 53.1 | |
| CLIPData=IT35M, Backbone=ViT-S, Framework=GroupViT2022.10 | 24.8 | 42.9 | |
| CrOCBackbone=ViT-S/16, Pre-training dataset=CC+2023.03 | 20.6 | — | |
| DenseCLBackbone=ResNet50, Pre-training dataset=IN2023.03 | 18 | — | |
| ReSimBackbone=ResNet50, Pre-training dataset=IN2023.03 | 17.1 | — | |
| CrOCBackbone=ViT-S/16, Pre-training dataset=CC2023.03 | 16.1 | — | |
| SoCoBackbone=ResNet50, Pre-training dataset=IN2023.03 | 15.1 | — | |
| VICRegLBackbone=ResNet50, Pre-training dataset=IN2023.03 | 13.9 | — | |
| BYOLBackbone=ResNet50, Pre-training dataset=CC+2023.03 | 13.6 | — | |
| ORLBackbone=ResNet50, Pre-training dataset=CC+2023.03 | 11.9 | — | |
| PixProBackbone=ResNet50, Pre-training dataset=IN2023.03 | 9.5 | — | |
| CP2Backbone=ViT-S/16, Pre-training dataset=IN2023.03 | 9.5 | — | |
| DINOBackbone=ViT-S/16, Pre-training dataset=CC2023.03 | 5.2 | — | |
| CrOCBackbone=ViT-S/16, Pre-training dataset=IN2023.03 | 3.8 | — | |
| MAEBackbone=ViT-S/16, Pre-training dataset=CC2023.03 | 3.3 | — |