Semantic Segmentation on PASCAL Context with background class
31.2mIoUCOSMOS w/ SCLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| COSMOS w/ SCLIPData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 31.2 | |
| TCLEvaluation Mode=Zero-shot2022.12 | 30.4 | |
| SCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 30.4 | |
| MaskCLIPRefinement=With heuristic refinement2022.12 | 23.6 | |
| MaskCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 23.2 | |
| MaskCLIP (Baseline)Refinement=None2022.12 | 21.1 | |
| ReCoEvaluation Mode=Zero-shot2022.12 | 19.9 | |
| GroupViT (YFCC)Training Data=YFCC + CC12M2022.12 | 19 | |
| GroupViT (RedCaps)Training Data=RedCaps + CC12M2022.12 | 18.7 | |
| COSMOSData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 12.5 | |
| OpenCLIPData Size=1B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 11.9 | |
| CLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 9.9 | |
| OpenCLIPData Size=2B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 9.6 | |
| OpenCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 9.1 |