Semantic Segmentation on COCO-Stuff without background class
48.6mIoUDouC
Evaluation Results
| Method | Links | |
|---|---|---|
| DouCBackbone=ViT-H, Training=Training-free, Instance Guidance=SAM22026.04 | 48.6 | |
| DouCBackbone=ViT-L, Training=Training-free, Instance Guidance=SAM22026.04 | 47.7 | |
| CorrCLIPBackbone=ViT-H, Training=Training-free, Instance Guidance=SAM22026.04 | 46.9 | |
| CorrCLIPBackbone=ViT-B, Training=Training-free, Instance Guidance=SAM22026.04 | 46.4 | |
| CorrCLIPBackbone=ViT-L, Training=Training-free, Instance Guidance=SAM22026.04 | 46.1 | |
| DouCBackbone=ViT-B, Training=Training-free, Instance Guidance=SAM22026.04 | 45.2 | |
| TridentBackbone=ViT-H, Training=Training-free2026.04 | 44.3 | |
| CLIPerBackbone=ViT-L, Training=Training-free2026.04 | 43.6 | |
| FreeDABackbone=ViT-L, Training=Training-free2026.04 | 43.5 | |
| TridentBackbone=ViT-B, Training=Training-free2026.04 | 42.2 | |
| SC-CLIPBackbone=ViT-L, Training=Training-free2026.04 | 40.6 | |
| FSABackbone=ViT-H, Training=Training-free2026.04 | 40.5 | |
| CASSBackbone=ViT-B, Training=Training-free2026.04 | 40.2 | |
| SFPBackbone=ViT-B, Training=Training-free2026.04 | 39.9 | |
| FSABackbone=ViT-B, Training=Training-free2026.04 | 39.9 | |
| DIH-CLIPBackbone=ViT-B, Training=Training-free2026.04 | 39.7 | |
| ProxyCLIPBackbone=ViT-H, Training=Training-free2026.04 | 39.6 | |
| FSABackbone=ViT-L, Training=Training-free2026.04 | 38.1 | |
| ProxyCLIPBackbone=ViT-L, Training=Training-free2026.04 | 37.7 | |
| NACLIPBackbone=ViT-B, Training=Training-free2026.04 | 35.2 | |
| ResCLIPBackbone=ViT-L, Training=Training-free2026.04 | 34.5 | |
| SCLIPBackbone=ViT-B, Training=Training-free2026.04 | 34.2 | |
| TagAlignPost-processing=false, Training Datasets=CC12M, Zero-shot evaluation=true2023.12 | 25.8 | |
| TagAlignPost-processing=true, Training Datasets=CC12M, Zero-shot evaluation=true2023.12 | 23.1 | |
| TCLEvaluation Mode=Zero-shot2022.12 | 22.4 | |
| TCLPost-processing=false, Training Datasets=CC3&12M, Zero-shot evaluation=true2023.12 | 22.4 | |
| TCLPost-processing=true, Training Datasets=CC3&12M, Zero-shot evaluation=true2023.12 | 19.6 | |
| MaskCLIPRefinement=With heuristic refinement2022.12 | 16.4 | |
| Dong et al.Post-processing=true, Training Datasets=LAION-20M, Zero-shot evaluation=true2023.12 | 16.4 | |
| ReCoPost-processing=false, Training Datasets=ImageNet1K, Zero-shot evaluation=true2023.12 | 16.3 | |
| SegCLIPPost-processing=true, Training Datasets=CC12M+COCO, Zero-shot evaluation=true2023.12 | 16.1 | |
| GroupViTPost-processing=false, Training Datasets=CC12M+YFCC, Zero-shot evaluation=true2023.12 | 15.4 | |
| GroupViT (RedCaps)Training Data=RedCaps + CC12M2022.12 | 15.3 | |
| CoCuPost-processing=false, Training Datasets=CC3&12M+YFCC, Zero-shot evaluation=true2023.12 | 15.2 | |
| Dong et al.Post-processing=false, Training Datasets=LAION-20M, Zero-shot evaluation=true2023.12 | 15.1 | |
| CoCuPost-processing=true, Training Datasets=CC3&12M+YFCC, Zero-shot evaluation=true2023.12 | 14.9 | |
| ReCoEvaluation Mode=Zero-shot2022.12 | 14.8 | |
| ReCoPost-processing=true, Training Datasets=ImageNet1K, Zero-shot evaluation=true2023.12 | 14.8 | |
| MaskCLIP (Baseline)Refinement=None2022.12 | 14.7 | |
| GroupViT (YFCC)Training Data=YFCC + CC12M2022.12 | 12.6 | |
| GroupViTPost-processing=true, Training Datasets=CC12M+YFCC, Zero-shot evaluation=true2023.12 | 12.6 | |
| OVSegmentorPost-processing=true, Training Datasets=CC12M*, Zero-shot evaluation=true2023.12 | 10.5 |