Open-vocabulary semantic segmentation on Cityscapes
69.7mIoUSegEarth-OV3
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SegEarth-OV3Venue=arXiv’25, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 69.7 | — | |
| ActiveSAMVenue=Ours, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 69.7 | — | |
| SAM 3Venue=ICLR’26, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 62.3 | — | |
| ReMEVenue=ICCV’25, Backbone (Size)=CLIP + §, Training Strategy=Training-free2026.06 | 59 | — | |
| VIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 55.7 | 52.4 | |
| CorrCLIPVenue=ICCV’25, Backbone (Size)=CLIP + †, Training Strategy=Training-free2026.06 | 51.1 | — | |
| CorrCLIPExtra Backbone=DINO+SAM2, Vision Model Configuration=Multi vision models2026.05 | 49.4 | 51 | |
| RF-CLIPVenue=AAAI’26, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 43 | — | |
| OVS-DINOBackbone=DINOv2 B/142026.04 | 42.9 | — | |
| TridentExtra Backbone=DINO+SAM, Vision Model Configuration=Multi vision models2026.05 | 42.9 | 45.8 | |
| TridentVenue=ICCV’25, Backbone (Size)=CLIP + ‡, Training Strategy=Training-free2026.06 | 42.9 | — | |
| SFPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 41.1 | 44 | |
| SFPVenue=ICCV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 41.1 | — | |
| SC-CLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 41 | 43.9 | |
| DIH-CLIPVenue=ICCV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 40.2 | — | |
| SPARBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=bilinear2026.04 | 40.1 | — | |
| Pre-trainedBackbone=DINOv3 - ViT-L-16, Inference=sliding-window, Upsampler=bilinear2026.04 | 39.7 | — | |
| CASSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 39.4 | 44.4 | |
| CASSVenue=CVPR’25, Backbone (Size)=CLIP + DINO (ViT-B/8), Training Strategy=Training-free2026.06 | 39.4 | — | |
| LPOSS + SPARBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 39.2 | — | |
| FSAExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 38.8 | 43.3 | |
| CLIPerExtra Backbone=Stable Diffusion, Vision Model Configuration=Multi vision models2026.05 | 38.7 | 45.3 | |
| SPARBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 38.6 | — | |
| Pre-trainedBackbone=SigLIP2 - ViT-B-16, Inference=sliding-window, Upsampler=bilinear2026.04 | 38.4 | — | |
| SPARBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 38.4 | — | |
| NACLIP*Pub. & Year=WACV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 38.3 | — | |
| ProxyCLIPExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 38.1 | 42.3 | |
| Talk2DINOVenue=ICCV’25, Backbone (Size)=CLIP + DINOv2†(ViT-B/14), Training Strategy=Training-based2026.06 | 38.1 | — | |
| LPOSSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 37.9 | 42.1 | |
| PEARLExtra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=false2026.03 | 37.6 | — | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv3 (ViT-B/16), Training free=✓, Mask Refinement=true2026.03 | 37.4 | — | |
| LPOSSVenue=CVPR’25, Backbone (Size)=CLIP + DINO (ViT-B/16), Training Strategy=Training-free2026.06 | 37.3 | — | |
| Talk2DINOBackbone=DINOv2 B/142026.04 | 36.6 | — | |
| SPARBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 36.1 | — | |
| SFP*Pub. & Year=ICCV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 36 | — | |
| DSGSBackbone=CLIP B/162026.04 | 36 | — | |
| Pre-trainedBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=bilinear2026.04 | 35.9 | — | |
| ResCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 35.6 | 41.2 | |
| NACLIPVenue=WACV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 35.5 | — | |
| ProxyCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 35.4 | — | |
| SigLIPv2 + UniRefinerViT=So/16, Background category=Without background category, Protocol=Zero-shot2026.05 | 34.6 | — | |
| LPOSS + Pre-tr.Backbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 34.5 | — | |
| FreeDAPub. & Year=CVPR’24, Extra data=COCO Captions, Extra backbone=DINOv2 (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 34.4 | — | |
| FreeCPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 34.4 | 42.2 | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 34.2 | — | |
| SCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 34.1 | — | |
| FreeDAVenue=CVPR’24, Backbone (Size)=CLIP + DINOv2 (ViT-B/14), Training Strategy=Training-free2026.06 | 34.1 | — | |
| ProxyCLIPVenue=ECCV’24, Backbone (Size)=CLIP + DINOv2†(ViT-B/14), Training Strategy=Training-free2026.06 | 33.9 | — | |
| +CS & AMF (GCLIP)Pub. & Year=Ours, Setting=TF-OVSS2025.02 | 33.7 | — | |
| Pre-trainedBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 33.2 | — | |
| Pre-trainedBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 32.4 | — | |
| SCLIPPub. & Year=ECCV’24, Setting=TF-OVSS2025.02 | 32.2 | — | |
| SCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 32.2 | 38.2 | |
| SCLIPVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 32.2 | — | |
| dino.txtBackbone=DINOv2 L/142026.04 | 32.1 | — | |
| CLIP + UniRefinerViT=G/14, Background category=Without background category, Protocol=Zero-shot2026.05 | 31.8 | — | |
| CLIP-DINOiserVenue=ECCV’24, Backbone (Size)=CLIP + DINO (ViT-B/16), Training Strategy=Training-based2026.06 | 31.7 | — | |
| CLIP-DINOiserPub. & Year=ECCV’24, Extra data=ImageNet-1K, Extra backbone=DINOv1 (ViT-B/16), Training free=✗, Mask Refinement=true2026.03 | 31.5 | — | |
| CLIPSurgeryPub. & Year=Arxiv’23, Setting=TF-OVSS2025.02 | 31.4 | — | |
| +CSPub. & Year=Ours, Setting=TF-OVSS2025.02 | 31.3 | — | |
| CLIP-DINOiserBackbone=CLIP B/162026.04 | 31.1 | — | |
| SynSegBackbone=CLIP B/162026.04 | 30.9 | — | |
| Pre-trainedBackbone=OpenCLIP - ViT-B-16, Inference=sliding-window, Upsampler=bilinear2026.04 | 30.8 | — | |
| GEM‡Pub. & Year=CVPR’24, Setting=TF-OVSS2025.02 | 30.8 | — | |
| EVA-CLIP + UniRefinerViT=8B/14, Background category=Without background category, Protocol=Zero-shot2026.05 | 30.1 | — | |
| ClearCLIPPub. & Year=ECCV’24, Setting=TF-OVSS2025.02 | 30 | — | |
| ClearCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 30 | 38.1 | |
| ClearCLIPVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 30 | — | |
| CoDeVenue=CVPR’24, Backbone (Size)=CLIP, Training Strategy=Training-based2026.06 | 28.9 | — | |
| PixelCLIP-ViTBackbone=CLIP B/162026.04 | 27.2 | — | |
| CLIPViT=G/14, Background category=Without background category, Protocol=Zero-shot2026.05 | 26.9 | — | |
| LaVGPub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv1 (ViT-B/8), Training free=✓, Mask Refinement=true2026.03 | 26.2 | — | |
| LaVGVenue=ECCV’24, Backbone (Size)=CLIP + DINO (ViT-B/8), Training Strategy=Training-free2026.06 | 26.2 | — | |
| SPARBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 26.1 | — | |
| SPARBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 25.7 | — | |
| MaskCLIP+†Pub. & Year=ECCV’22, Setting=USS2025.02 | 25.2 | — | |
| LaVGExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 25 | 38.2 | |
| CoDeBackbone=CLIP B/162026.04 | 24.4 | — | |
| TCLPub. & Year=CVPR’23, Extra data=CC3M+CC12M, Extra backbone=✗, Training free=✗, Mask Refinement=true2026.03 | 24 | — | |
| CdamCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 23.7 | — | |
| SigLIPv2ViT=So/16, Background category=Without background category, Protocol=Zero-shot2026.05 | 23.6 | — | |
| Pre-trainedBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 23.5 | — | |
| TCLBackbone=CLIP B/162026.04 | 23.1 | — | |
| TCLPub. & Year=CVPR’23, Setting=T-OVSS2025.02 | 23.1 | — | |
| TCLVenue=CVPR’23, Backbone (Size)=CLIP, Training Strategy=Training-based2026.06 | 23.1 | — | |
| ReCoPub. & Year=NeurIPS’22, Extra data=ImageNet-1K, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 22.8 | — | |
| NaFlexBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 22.8 | — | |
| dino.txtExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 22.6 | 31.8 | |
| CLIPtraseVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 21.3 | — | |
| ReCoBackbone=CLIP B/162026.04 | 21.1 | — | |
| Pre-trainedBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 20.9 | — | |
| ReCLIPPub. & Year=CVPR’24, Setting=USS2025.02 | 19.9 | — | |
| MaskCLIP†Pub. & Year=ECCV’22, Setting=TF-OVSS2025.02 | 19.8 | — | |
| Pre-trainedBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 17.7 | — | |
| CoCuPub. & Year=NeurIPS’24, Setting=T-OVSS2025.02 | 15 | — | |
| MaskCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 12.6 | 27.9 | |
| GroupViTPub. & Year=CVPR’22, Extra data=CC12M+RedCaps, Extra backbone=✗, Training free=✗, Mask Refinement=true2026.03 | 11.6 | — | |
| EVA-CLIPViT=8B/14, Background category=Without background category, Protocol=Zero-shot2026.05 | 11.4 | — | |
| MaskCLIPPub. & Year=ECCV’22, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 11.2 | — | |
| GroupViTBackbone=CLIP S/162026.04 | 11.1 | — |