Semantic Segmentation on PASCAL VOC without background category 2012
80.4mIoUSCLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| SCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 80.4 | |
| COSMOS w/ SCLIPData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 77.7 | |
| SILC-CData Size=10B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 77.5 | |
| MaskCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 74.9 | |
| COSMOSData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 53.6 | |
| OpenCLIPData Size=1B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 51.3 | |
| OpenCLIPData Size=2B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 51.3 | |
| CLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 49.4 | |
| OpenCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 43.8 |