Semantic Segmentation on PASCAL VOC with background category VOC21 2012
86.8mIoUCoCo-SAM3
Evaluation Results
| Method | Links | |
|---|---|---|
| CoCo-SAM3Paradigm=Training-free SAM32026.04 | 86.8 | |
| ReMEParadigm=Training-free CLIP-VFM2026.04 | 82.2 | |
| SAM3Paradigm=Training-free SAM32026.04 | 81.9 | |
| CorrCLIPParadigm=Training-free CLIP-VFM2026.04 | 76.7 | |
| CorrCLIPBackbone=ViT-H, Training=Training-free, Instance Guidance=SAM22026.04 | 75.5 | |
| DouCBackbone=ViT-H, Training=Training-free, Instance Guidance=SAM22026.04 | 74.3 | |
| DouCBackbone=ViT-L, Training=Training-free, Instance Guidance=SAM22026.04 | 73.1 | |
| DouCBackbone=ViT-B, Training=Training-free, Instance Guidance=SAM22026.04 | 72.2 | |
| CorrCLIPBackbone=ViT-B, Training=Training-free, Instance Guidance=SAM22026.04 | 72 | |
| CorrCLIPBackbone=ViT-L, Training=Training-free, Instance Guidance=SAM22026.04 | 71.2 | |
| TridentBackbone=ViT-H, Training=Training-free2026.04 | 70.8 | |
| CLIPerBackbone=ViT-L, Training=Training-free2026.04 | 69.8 | |
| FSABackbone=ViT-H, Training=Training-free2026.04 | 67.9 | |
| RF-CLIPParadigm=Training-free CLIP-Only2026.04 | 67.2 | |
| TridentParadigm=Training-free CLIP-VFM2026.04 | 67.1 | |
| TridentBackbone=ViT-B, Training=Training-free2026.04 | 67.1 | |
| Talk2DINOParadigm=Training-based2026.04 | 65.8 | |
| CASSParadigm=Training-free CLIP-VFM2026.04 | 65.8 | |
| CASSBackbone=ViT-B, Training=Training-free2026.04 | 65.8 | |
| SC-CLIPBackbone=ViT-L, Training=Training-free2026.04 | 65 | |
| ProxyCLIPBackbone=ViT-H, Training=Training-free2026.04 | 65 | |
| DIH-CLIPBackbone=ViT-B, Training=Training-free2026.04 | 64.2 | |
| SFPParadigm=Training-free CLIP-Only2026.04 | 63.9 | |
| SFPBackbone=ViT-B, Training=Training-free2026.04 | 63.9 | |
| FSABackbone=ViT-B, Training=Training-free2026.04 | 63.7 | |
| CLIP-DINOiserParadigm=Training-based2026.04 | 62.1 | |
| FSABackbone=ViT-L, Training=Training-free2026.04 | 61.8 | |
| ProxyCLIPBackbone=ViT-L, Training=Training-free2026.04 | 60.6 | |
| SCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 59.1 | |
| SCLIPParadigm=Training-free CLIP-Only2026.04 | 59.1 | |
| SCLIPBackbone=ViT-B, Training=Training-free2026.04 | 59.1 | |
| NACLIPParadigm=Training-free CLIP-Only2026.04 | 58.9 | |
| NACLIPBackbone=ViT-B, Training=Training-free2026.04 | 58.9 | |
| CDAMBackbone=ViT-B, Training=Training-free2026.04 | 58.7 | |
| ProxyCLIPParadigm=Training-free CLIP-VFM2026.04 | 58.6 | |
| FreeDABackbone=ViT-L, Training=Training-free2026.04 | 55.4 | |
| ResCLIPBackbone=ViT-L, Training=Training-free2026.04 | 54.1 | |
| COSMOS w/ SCLIPData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 52.8 | |
| ClearCLIPParadigm=Training-free CLIP-Only2026.04 | 51.8 | |
| FreeDAParadigm=Training-free CLIP-VFM2026.04 | 51.8 | |
| TCLParadigm=Training-based2026.04 | 51.2 | |
| CLIPtraseParadigm=Training-free CLIP-Only2026.04 | 50.9 | |
| GroupViTParadigm=Training-based2026.04 | 50.4 | |
| CaRParadigm=Training-free CLIP-Only2026.04 | 48.6 | |
| MaskCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 43.1 | |
| COSMOSData Size=30M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 29.6 | |
| OpenCLIPData Size=1B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 22.5 | |
| OpenCLIPData Size=2B, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 19.8 | |
| CLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 18.8 | |
| CLIPParadigm=Training-free CLIP-Only2026.04 | 18.6 | |
| OpenCLIPData Size=400M, Zero-shot=true, Vision Encoder Architecture=ViT-B/162024.12 | 18.4 |