Semantic Segmentation on COCO-Object with background class
67.9mIoUCoCo-SAM3
Evaluation Results
| Method | Links | |
|---|---|---|
| CoCo-SAM3Paradigm=Training-free SAM32026.04 | 67.9 | |
| SAM3Paradigm=Training-free SAM32026.04 | 65.4 | |
| CorrCLIPParadigm=Training-free CLIP-VFM2026.04 | 49.4 | |
| ReMEParadigm=Training-free CLIP-VFM2026.04 | 48.2 | |
| Talk2DINOParadigm=Training-based2026.04 | 45.1 | |
| CLIPtraseParadigm=Training-free CLIP-Only2026.04 | 43.6 | |
| TridentParadigm=Training-free CLIP-VFM2026.04 | 41.1 | |
| RF-CLIPParadigm=Training-free CLIP-Only2026.04 | 39.1 | |
| SFPParadigm=Training-free CLIP-Only2026.04 | 37.9 | |
| CASSParadigm=Training-free CLIP-VFM2026.04 | 37.8 | |
| ProxyCLIPParadigm=Training-free CLIP-VFM2026.04 | 37.4 | |
| FreeDAParadigm=Training-free CLIP-VFM2026.04 | 36.3 | |
| CLIP-DINOiserParadigm=Training-based2026.04 | 34.8 | |
| NACLIPParadigm=Training-free CLIP-Only2026.04 | 33.2 | |
| ClearCLIPParadigm=Training-free CLIP-Only2026.04 | 33 | |
| TCLEvaluation Mode=Zero-shot2022.12 | 31.6 | |
| COSMOS w/ SCLIPData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 31.3 | |
| SCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 30.5 | |
| SCLIPParadigm=Training-free CLIP-Only2026.04 | 30.5 | |
| TCLParadigm=Training-based2026.04 | 30.4 | |
| GroupViT (RedCaps)Training Data=RedCaps + CC12M2022.12 | 27.5 | |
| GroupViTParadigm=Training-based2026.04 | 27.5 | |
| GroupViT (YFCC)Training Data=YFCC + CC12M2022.12 | 24.3 | |
| MaskCLIPRefinement=With heuristic refinement2022.12 | 20.6 | |
| MaskCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 20.6 | |
| ReCoEvaluation Mode=Zero-shot2022.12 | 15.7 | |
| MaskCLIP (Baseline)Refinement=None2022.12 | 15.5 | |
| CaRParadigm=Training-free CLIP-Only2026.04 | 15.4 | |
| COSMOSData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 15.2 | |
| OpenCLIPData Size=1B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 11.4 | |
| OpenCLIPData Size=2B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 9.9 | |
| OpenCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 8.7 | |
| CLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 8.1 | |
| CLIPParadigm=Training-free CLIP-Only2026.04 | 6.5 |