Open-Vocabulary Semantic Segmentation on COCOStuff (val)
46.4mIoUCONCEPTBANK
Evaluation Results
| Method | Links | |
|---|---|---|
| CONCEPTBANKBackbone (Size)=SAM3 (PE-L+/14), Optimization protocol=Parameter-free2026.02 | 46.4 | |
| SegEarth-OV3Size=PE-L+/142025.12 | 42.8 | |
| CorrCLIPBackbone (Size)=CLIP (ViT-L/14) + DINO (ViT-B/8) + SAM2 (Hiera-L), Optimization protocol=Parameter-free2026.02 | 34 | |
| CorrCLIPSize=ViT-L/14, Training Protocol=Training-free2025.12 | 34 | |
| ReMEBackbone (Size)=CLIP + DINOv2 (ViT-L/14) + SAM (ViT-L/16), Optimization protocol=Parameter-free2026.02 | 33.3 | |
| SAM3Backbone (Size)=SAM3 (PE-L+/14), Optimization protocol=Parameter-free2026.02 | 33.3 | |
| CorrCLIPSize=ViT-H/14, Training Protocol=Training-free2025.12 | 32.7 | |
| CorrCLIPSize=ViT-B/16, Training Protocol=Training-free2025.12 | 31.6 | |
| SAM-CLIPBackbone (Size)=CLIP + SAM (ViT-B/16), Optimization protocol=Training-based2026.02 | 31.5 | |
| Talk2DINOBackbone (Size)=CLIP + DINOv2 with registers (ViT-B/14), Optimization protocol=Training-based2026.02 | 30.2 | |
| FreeDASize=ViT-L/14, Training Protocol=Training-free2025.12 | 28.8 | |
| CLIPerSize=ViT-L/14, Training Protocol=Training-free2025.12 | 28.7 | |
| TridentSize=ViT-H/14, Training Protocol=Training-free2025.12 | 28.6 | |
| TridentBackbone (Size)=CLIP + DINO (ViT-B/16) + SAM (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 28.3 | |
| TridentSize=ViT-B/16, Training Protocol=Training-free2025.12 | 28.3 | |
| RF-CLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 27.5 | |
| CLIPerSize=ViT-B/16, Training Protocol=Training-free2025.12 | 27.5 | |
| SC-CLIPSize=ViT-L/14, Training Protocol=Training-free2025.12 | 26.9 | |
| ProxyCLIPSize=ViT-H/14, Training Protocol=Training-free2025.12 | 26.8 | |
| CASSBackbone (Size)=CLIP + DINO (ViT-B/8), Optimization protocol=Parameter-free2026.02 | 26.7 | |
| DIH-CLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 26.7 | |
| CASSSize=ViT-B/16, Training Protocol=Training-free2025.12 | 26.7 | |
| SC-CLIPSize=ViT-B/16, Training Protocol=Training-free2025.12 | 26.6 | |
| ProxyCLIPSize=ViT-B/16, Training Protocol=Training-free2025.12 | 26.5 | |
| SFPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 26.4 | |
| LPOSSBackbone (Size)=CLIP + DINO (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 25.9 | |
| FreeDABackbone (Size)=CLIP + DINOv2 (ViT-B/14), Optimization protocol=Parameter-free2026.02 | 25.7 | |
| NACLIPSize=ViT-B/16, Training Protocol=Training-free2025.12 | 25.7 | |
| ProxyCLIPSize=ViT-L/14, Training Protocol=Training-free2025.12 | 25.6 | |
| ProxyCLIPBackbone (Size)=CLIP + DINOv2 with registers (ViT-B/14), Optimization protocol=Parameter-free2026.02 | 25.4 | |
| ClearCLIPUpsampling=SimFeatUp2024.10 | 25.1 | |
| ResCLIPSize=ViT-B/16, Training Protocol=Training-free2025.12 | 24.7 | |
| CLIP-DINOiserBackbone (Size)=CLIP + DINO (ViT-B/16), Optimization protocol=Training-based2026.02 | 24.6 | |
| CLIP-DINOiserSize=ViT-B/16, Training Protocol=Training-based2025.12 | 24.6 | |
| CLIPtraseSize=ViT-B/16, Training Protocol=Training-free2025.12 | 24.1 | |
| ClearCLIPUpsampling=Original2024.10 | 23.9 | |
| CoDeBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Training-based2026.02 | 23.9 | |
| ClearCLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 23.9 | |
| CoDeSize=ViT-B/16, Training Protocol=Training-based2025.12 | 23.9 | |
| ClearCLIPSize=ViT-B/16, Training Protocol=Training-free2025.12 | 23.9 | |
| ResCLIPSize=ViT-L/14, Training Protocol=Training-free2025.12 | 23.4 | |
| NACLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 23.3 | |
| LaVGBackbone (Size)=CLIP + DINO (ViT-B/8), Optimization protocol=Parameter-free2026.02 | 23.2 | |
| LaVGSize=ViT-B/16, Training Protocol=Training-free2025.12 | 23.2 | |
| CLIPtraseBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 22.8 | |
| SCLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 22.4 | |
| TCLSize=ViT-B/16, Training Protocol=Training-based2025.12 | 22.4 | |
| SCLIPSize=ViT-B/16, Training Protocol=Training-free2025.12 | 22.4 | |
| SCLIPUpsampling=SimFeatUp2024.10 | 22 | |
| SCLIPUpsampling=Original2024.10 | 21.1 | |
| TCLUpsampling=Original2024.10 | 19.6 | |
| TCLBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Training-based2026.02 | 19.6 | |
| MaskCLIPUpsampling=SimFeatUp2024.10 | 18 | |
| MaskCLIPUpsampling=Original2024.10 | 16.4 | |
| MaskCLIPSize=ViT-B/16, Training Protocol=Training-free2025.12 | 16.4 | |
| GEMBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 15.7 | |
| GroupViTBackbone (Size)=GroupViT (ViT-S/16), Optimization protocol=Training-based2026.02 | 15.3 | |
| RecoUpsampling=Original2024.10 | 14.8 | |
| CLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 7.2 | |
| CLIPSize=ViT-B/16, Training Protocol=Training-free2025.12 | 4.4 |