Semantic Segmentation on Average Overall
64.3mIoUCoCo-SAM3
Evaluation Results
| Method | Links | |
|---|---|---|
| CoCo-SAM3Paradigm=Training-free SAM32026.04 | 64.3 | |
| SAM3Paradigm=Training-free SAM32026.04 | 57.5 | |
| ReMEParadigm=Training-free CLIP-VFM2026.04 | 55.2 | |
| CorrCLIPParadigm=Training-free CLIP-VFM2026.04 | 53.6 | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 51.9 | |
| OV-StitcherBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 51.6 | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 51 | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=true2026.04 | 50.7 | |
| CorrCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 50.6 | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=false2026.04 | 48.9 | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=true2026.04 | 48.7 | |
| TridentBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 47.4 | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=false2026.04 | 46.8 | |
| Talk2DINOParadigm=Training-based2026.04 | 46.3 | |
| TridentBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 45.8 | |
| TridentParadigm=Training-free CLIP-VFM2026.04 | 45.8 | |
| RF-CLIPParadigm=Training-free CLIP-Only2026.04 | 45.5 | |
| SC-CLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 45.2 | |
| TridentBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 45.1 | |
| CASSBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 44.4 | |
| CASSParadigm=Training-free CLIP-VFM2026.04 | 44.4 | |
| SFPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 44 | |
| SFPParadigm=Training-free CLIP-Only2026.04 | 44 | |
| SC-CLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 43.9 | |
| ProxyCLIPBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 43.9 | |
| ProxyCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 43 | |
| ProxyCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 42.3 | |
| ResCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 41.4 | |
| ProxyCLIPParadigm=Training-free CLIP-VFM2026.04 | 41.1 | |
| FreeDAParadigm=Training-free CLIP-VFM2026.04 | 41 | |
| CLIP-DINOiserParadigm=Training-based2026.04 | 40.3 | |
| NACLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 39.4 | |
| NACLIPParadigm=Training-free CLIP-Only2026.04 | 39.4 | |
| ResCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 39.1 | |
| SCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 38.2 | |
| SCLIPParadigm=Training-free CLIP-Only2026.04 | 38.2 | |
| ClearCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 38.1 | |
| ClearCLIPParadigm=Training-free CLIP-Only2026.04 | 38.1 | |
| TCLParadigm=Training-based2026.04 | 33.9 | |
| CLIPtraseBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 32.7 | |
| MaskCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 30.3 | |
| GroupViTParadigm=Training-based2026.04 | 29.4 | |
| MaskCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 13.9 | |
| CLIPParadigm=Training-free CLIP-Only2026.04 | 13.8 | |
| CLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 13.6 | |
| CLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 5.2 |