Semantic Segmentation on Pascal Context 60 with background
50.5mIoUCoCo-SAM3
Evaluation Results
| Method | Links | |
|---|---|---|
| CoCo-SAM3Paradigm=Training-free SAM32026.04 | 50.5 | |
| CorrCLIPBackbone=ViT-H, Training=Training-free, Instance Guidance=SAM22026.04 | 48.1 | |
| DouCBackbone=ViT-H, Training=Training-free, Instance Guidance=SAM22026.04 | 47.8 | |
| DouCBackbone=ViT-L, Training=Training-free, Instance Guidance=SAM22026.04 | 47.2 | |
| SAM3Paradigm=Training-free SAM32026.04 | 46.1 | |
| CorrCLIPBackbone=ViT-L, Training=Training-free, Instance Guidance=SAM22026.04 | 45.7 | |
| CorrCLIPParadigm=Training-free CLIP-VFM2026.04 | 44.9 | |
| ReMEParadigm=Training-free CLIP-VFM2026.04 | 44.6 | |
| DouCBackbone=ViT-B, Training=Training-free, Instance Guidance=SAM22026.04 | 43.8 | |
| CLIPerBackbone=ViT-L, Training=Training-free2026.04 | 43.3 | |
| TridentBackbone=ViT-H, Training=Training-free2026.04 | 42.2 | |
| TridentBackbone=ViT-B, Training=Training-free2026.04 | 41.1 | |
| CorrCLIPBackbone=ViT-B, Training=Training-free, Instance Guidance=SAM22026.04 | 40.7 | |
| SC-CLIPBackbone=ViT-L, Training=Training-free2026.04 | 40.5 | |
| FSABackbone=ViT-L, Training=Training-free2026.04 | 40.2 | |
| FSABackbone=ViT-H, Training=Training-free2026.04 | 40.2 | |
| ProxyCLIPBackbone=ViT-L, Training=Training-free2026.04 | 39.2 | |
| TridentParadigm=Training-free CLIP-VFM2026.04 | 38.6 | |
| ProxyCLIPBackbone=ViT-H, Training=Training-free2026.04 | 38.6 | |
| FSABackbone=ViT-B, Training=Training-free2026.04 | 38 | |
| RF-CLIPParadigm=Training-free CLIP-Only2026.04 | 37.9 | |
| SFPBackbone=ViT-B, Training=Training-free2026.04 | 37.9 | |
| CASSBackbone=ViT-B, Training=Training-free2026.04 | 37.8 | |
| Talk2DINOParadigm=Training-based2026.04 | 37.7 | |
| DIH-CLIPBackbone=ViT-B, Training=Training-free2026.04 | 37.4 | |
| FreeDABackbone=ViT-L, Training=Training-free2026.04 | 37.4 | |
| SFPParadigm=Training-free CLIP-Only2026.04 | 37.2 | |
| CASSParadigm=Training-free CLIP-VFM2026.04 | 36.7 | |
| FreeDAParadigm=Training-free CLIP-VFM2026.04 | 35.3 | |
| CDAMBackbone=ViT-B, Training=Training-free2026.04 | 35.2 | |
| ProxyCLIPParadigm=Training-free CLIP-VFM2026.04 | 33.8 | |
| NACLIPBackbone=ViT-B, Training=Training-free2026.04 | 33.2 | |
| ClearCLIPParadigm=Training-free CLIP-Only2026.04 | 32.6 | |
| ResCLIPBackbone=ViT-L, Training=Training-free2026.04 | 32.5 | |
| CLIP-DINOiserParadigm=Training-based2026.04 | 32.4 | |
| NACLIPParadigm=Training-free CLIP-Only2026.04 | 32.2 | |
| SCLIPBackbone=ViT-B, Training=Training-free2026.04 | 30.5 | |
| SCLIPParadigm=Training-free CLIP-Only2026.04 | 30.4 | |
| CLIPtraseParadigm=Training-free CLIP-Only2026.04 | 29.9 | |
| TCLParadigm=Training-based2026.04 | 24.3 | |
| GroupViTParadigm=Training-based2026.04 | 18.7 | |
| CaRParadigm=Training-free CLIP-Only2026.04 | 13.6 | |
| CLIPParadigm=Training-free CLIP-Only2026.04 | 7.8 |