Semantic Segmentation on 8 Dataset Aggregate (VOC, Context, Object, VOC20, Context59, Stuff, City, ADE)
44.4mIoU (Average)ProxyCLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| ProxyCLIPBackbone=OpenCLIP-ViT-H/14, Training Strategy=Zero-shot2024.08 | 44.4 | |
| ProxyCLIPBackbone=CLIP-ViT-L/14, Training Strategy=Zero-shot2024.08 | 43 | |
| ProxyCLIPBackbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 42.3 | |
| CLIP-DINOiserTraining Strategy=Training-based2024.08 | 40.3 | |
| SCLIPBackbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 38.2 | |
| TCLTraining Strategy=Training-based2024.08 | 33.1 | |
| SCLIPBackbone=OpenCLIP-ViT-H/14, Training Strategy=Zero-shot2024.08 | 29.1 | |
| SCLIPBackbone=CLIP-ViT-L/14, Training Strategy=Zero-shot2024.08 | 29 | |
| MaskCLIP+Backbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 27.9 | |
| GroupViTTraining Strategy=Training-based2024.08 | 27.7 | |
| ReCo+Backbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 23.5 | |
| MaskCLIPBackbone=OpenCLIP-ViT-H/14, Training Strategy=Zero-shot2024.08 | 19.3 | |
| MaskCLIPBackbone=CLIP-ViT-L/14, Training Strategy=Zero-shot2024.08 | 13.9 | |
| CLIPBackbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 11.7 | |
| OpenCLIPBackbone=OpenCLIP-ViT-H/14, Training Strategy=Zero-shot2024.08 | 7.1 | |
| CLIPBackbone=CLIP-ViT-L/14, Training Strategy=Zero-shot2024.08 | 5.2 |