Open-Vocabulary Semantic Segmentation on Cityscapes (val)
75.1mIoUCONCEPTBANK
Evaluation Results
| Method | Links | |
|---|---|---|
| CONCEPTBANKBackbone (Size)=SAM3 (PE-L+/14), Optimization protocol=Parameter-free2026.02 | 75.1 | |
| Oracleevaluation protocol=oracle2025.03 | 67.47 | |
| SemLAfusion strategy=LoRA merging, tau=0.05, K=5, evaluation protocol=leave-one-out2025.03 | 63.91 | |
| SemLAfusion strategy=Late Fusion2025.03 | 62.86 | |
| SAM3Backbone (Size)=SAM3 (PE-L+/14), Optimization protocol=Parameter-free2026.02 | 62.3 | |
| Uniform mergingfusion strategy=LoRA merging2025.03 | 62.18 | |
| Uniformfusion strategy=Late Fusion2025.03 | 61.82 | |
| ReMEBackbone (Size)=CLIP + DINOv2 (ViT-L/14) + SAM (ViT-L/16), Optimization protocol=Parameter-free2026.02 | 59 | |
| T-REN+Approach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=576, Input Resolution=1344p2026.04 | 58.7 | |
| T-RENApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=576, Input Resolution=384p2026.04 | 52.7 | |
| CorrCLIPBackbone (Size)=CLIP (ViT-L/14) + DINO (ViT-B/8) + SAM2 (Hiera-L), Optimization protocol=Parameter-free2026.02 | 51.1 | |
| TextRegionApproach Type=SAM-guided, Backbone=ViT-H, Input Resolution=1344p2026.04 | 47.4 | |
| CAT-Segevaluation protocol=zero-shot2025.03 | 47.11 | |
| TridentApproach Type=SAM-guided, Backbone=ViT-H, Input Resolution=1344p2026.04 | 46.9 | |
| RADSeg+Approach Type=SAM-guided, Backbone=ViT-H, Input Resolution=1344p2026.04 | 45.8 | |
| RF-CLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 43 | |
| TridentBackbone (Size)=CLIP + DINO (ViT-B/16) + SAM (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 42.9 | |
| SFPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 41.1 | |
| DIH-CLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 40.2 | |
| CASSBackbone (Size)=CLIP + DINO (ViT-B/8), Optimization protocol=Parameter-free2026.02 | 39.4 | |
| Talk2DINOBackbone (Size)=CLIP + DINOv2 with registers (ViT-B/14), Optimization protocol=Training-based2026.02 | 38.1 | |
| LPOSSBackbone (Size)=CLIP + DINO (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 37.3 | |
| CLIPixtraining=false2026.07 | 37.1 | |
| DINOv3 dino.txtApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 36.9 | |
| ResCLIPtraining=false2026.07 | 35.9 | |
| NACLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 35.5 | |
| FreeDABackbone (Size)=CLIP + DINOv2 (ViT-B/14), Optimization protocol=Parameter-free2026.02 | 34.1 | |
| ProxyCLIPBackbone (Size)=CLIP + DINOv2 with registers (ViT-B/14), Optimization protocol=Parameter-free2026.02 | 33.9 | |
| SCLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 32.2 | |
| SCLIPtraining=false2026.07 | 32.2 | |
| CLIP-DINOiserBackbone (Size)=CLIP + DINO (ViT-B/16), Optimization protocol=Training-based2026.02 | 31.7 | |
| CLIP-DINOisertraining=true2026.07 | 31.7 | |
| ClearCLIPUpsampling=SimFeatUp2024.10 | 30.7 | |
| SCLIPUpsampling=SimFeatUp2024.10 | 30.5 | |
| ClearCLIPUpsampling=Original2024.10 | 30 | |
| ClearCLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 30 | |
| ClearCLIPtraining=false2026.07 | 30 | |
| SCLIPUpsampling=Original2024.10 | 29.1 | |
| CoDeBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Training-based2026.02 | 28.9 | |
| DINOv2 dino.txtApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 27.4 | |
| LaVGBackbone (Size)=CLIP + DINO (ViT-B/8), Optimization protocol=Parameter-free2026.02 | 26.2 | |
| MaskCLIPUpsampling=SimFeatUp2024.10 | 25.8 | |
| TCLUpsampling=Original2024.10 | 23.1 | |
| TCLBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Training-based2026.02 | 23.1 | |
| TCLtraining=true2026.07 | 23.1 | |
| PEApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 21.4 | |
| CLIPtraseBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 21.3 | |
| RecoUpsampling=Original2024.10 | 21.1 | |
| SigLIP-2Approach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 16.3 | |
| EVA-02-CLIPApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 14.1 | |
| MaskCLIPUpsampling=Original2024.10 | 12.6 | |
| CLIPApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 11.5 | |
| GroupViTBackbone (Size)=GroupViT (ViT-S/16), Optimization protocol=Training-based2026.02 | 11.1 | |
| GroupViTtraining=true2026.07 | 11.1 | |
| CLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 6.7 | |
| CLIPtraining=false2026.07 | 5 |