Semantic Segmentation on PASCAL Context without background class 59
38.6mIoUTagAlign
Evaluation Results
| Method | Links | |
|---|---|---|
| TagAlignPost-processing=false, Training Datasets=CC12M, Zero-shot evaluation=true2023.12 | 38.6 | |
| TagAlignPost-processing=true, Training Datasets=CC12M, Zero-shot evaluation=true2023.12 | 35.1 | |
| SCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 34.2 | |
| TCLEvaluation Mode=Zero-shot2022.12 | 33.9 | |
| TCLPost-processing=false, Training Datasets=CC3&12M, Zero-shot evaluation=true2023.12 | 33.9 | |
| COSMOS w/ SCLIPData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 33.7 | |
| SILC-CData Size=10B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 31.6 | |
| TCLPost-processing=true, Training Datasets=CC3&12M, Zero-shot evaluation=true2023.12 | 30.3 | |
| MaskCLIPRefinement=With heuristic refinement2022.12 | 26.4 | |
| Dong et al.Post-processing=true, Training Datasets=LAION-20M, Zero-shot evaluation=true2023.12 | 26.4 | |
| MaskCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 26.4 | |
| Dong et al.Post-processing=false, Training Datasets=LAION-20M, Zero-shot evaluation=true2023.12 | 25.3 | |
| SegCLIPPost-processing=true, Training Datasets=CC12M+COCO, Zero-shot evaluation=true2023.12 | 24.8 | |
| ReCoPost-processing=false, Training Datasets=ImageNet1K, Zero-shot evaluation=true2023.12 | 24.7 | |
| GroupViTPost-processing=false, Training Datasets=CC12M+YFCC, Zero-shot evaluation=true2023.12 | 23.8 | |
| GroupViT (RedCaps)Training Data=RedCaps + CC12M2022.12 | 23.4 | |
| MaskCLIP (Baseline)Refinement=None2022.12 | 23.3 | |
| ReCoEvaluation Mode=Zero-shot2022.12 | 22.3 | |
| ReCoPost-processing=true, Training Datasets=ImageNet1K, Zero-shot evaluation=true2023.12 | 22.3 | |
| GroupViT (YFCC)Training Data=YFCC + CC12M2022.12 | 20.8 | |
| GroupViTPost-processing=true, Training Datasets=CC12M+YFCC, Zero-shot evaluation=true2023.12 | 20.8 | |
| OVSegmentorPost-processing=true, Training Datasets=CC12M*, Zero-shot evaluation=true2023.12 | 19.2 | |
| COSMOSData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 15.7 | |
| OpenCLIPData Size=1B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 12.6 | |
| CLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 11.1 | |
| OpenCLIPData Size=2B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 10.2 | |
| OpenCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 9.8 |