Open-vocabulary semantic segmentation on ADE20K
40mIoUActiveSAM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ActiveSAMVenue=Ours, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 40 | — | — | |
| ActiveSAM2026.06 | 40 | — | 1.92 | |
| SegEarth-OV3Venue=arXiv’25, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 37.6 | — | — | |
| SegEarth-OV32026.06 | 37.6 | — | 0.35 | |
| SAM 3Venue=ICLR’26, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 31.8 | — | — | |
| SAM^32026.06 | 31.8 | — | 0.13 | |
| CorrCLIPVenue=ICCV’25, Backbone (Size)=CLIP + †, Training Strategy=Training-free2026.06 | 30.7 | — | — | |
| VIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 29.1 | 52.4 | — | |
| ReMEVenue=ICCV’25, Backbone (Size)=CLIP + §, Training Strategy=Training-free2026.06 | 28.2 | — | — | |
| CorrCLIPExtra Backbone=DINO+SAM2, Vision Model Configuration=Multi vision models2026.05 | 26.9 | 51 | — | |
| SPARBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 26.1 | — | — | |
| LPOSS + SPARBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 25.8 | — | — | |
| SPARBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 25.6 | — | — | |
| SPARBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=bilinear2026.04 | 25.4 | — | — | |
| Pre-trainedBackbone=DINOv3 - ViT-L-16, Inference=sliding-window, Upsampler=bilinear2026.04 | 24.9 | — | — | |
| Pre-trainedBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 24.9 | — | — | |
| Pre-trainedBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=bilinear2026.04 | 24.4 | — | — | |
| SPARBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 23.4 | — | — | |
| Pre-trainedBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 23.1 | — | — | |
| Talk2DINOVenue=ICCV’25, Backbone (Size)=CLIP + DINOv2†(ViT-B/14), Training Strategy=Training-based2026.06 | 22.5 | — | — | |
| LPOSSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 22.3 | 42.1 | — | |
| CLIPerExtra Backbone=Stable Diffusion, Vision Model Configuration=Multi vision models2026.05 | 22 | 45.3 | — | |
| TridentExtra Backbone=DINO+SAM, Vision Model Configuration=Multi vision models2026.05 | 21.9 | 45.8 | — | |
| TridentVenue=ICCV’25, Backbone (Size)=CLIP + ‡, Training Strategy=Training-free2026.06 | 21.9 | — | — | |
| Pre-trainedBackbone=SigLIP2 - ViT-B-16, Inference=sliding-window, Upsampler=bilinear2026.04 | 21.8 | — | — | |
| LPOSSVenue=CVPR’25, Backbone (Size)=CLIP + DINO (ViT-B/16), Training Strategy=Training-free2026.06 | 21.8 | — | — | |
| SigLIPv2 + UniRefinerViT=So/16, Background category=Without background category, Protocol=Zero-shot2026.05 | 21.7 | — | — | |
| CLIP + UniRefinerViT=G/14, Background category=Without background category, Protocol=Zero-shot2026.05 | 21.6 | — | — | |
| Talk2DINOBackbone=DINOv2 B/142026.04 | 21.1 | — | — | |
| RF-CLIPVenue=AAAI’26, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 21 | — | — | |
| FreeDAPub. & Year=CVPR’24, Extra data=COCO Captions, Extra backbone=DINOv2 (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 20.9 | — | — | |
| SFPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 20.8 | 44 | — | |
| FreeDAVenue=CVPR’24, Backbone (Size)=CLIP + DINOv2 (ViT-B/14), Training Strategy=Training-free2026.06 | 20.8 | — | — | |
| SFPVenue=ICCV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 20.8 | — | — | |
| DSGSBackbone=CLIP B/162026.04 | 20.7 | — | — | |
| CLIP-DINOiserPub. & Year=ECCV’24, Extra data=ImageNet-1K, Extra backbone=DINOv1 (ViT-B/16), Training free=✗, Mask Refinement=true2026.03 | 20.6 | — | — | |
| dino.txtBackbone=DINOv2 L/142026.04 | 20.6 | — | — | |
| OVS-DINOBackbone=DINOv2 B/142026.04 | 20.6 | — | — | |
| FSAExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 20.5 | 43.3 | — | |
| CASSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 20.4 | 44.4 | — | |
| CASSVenue=CVPR’25, Backbone (Size)=CLIP + DINO (ViT-B/8), Training Strategy=Training-free2026.06 | 20.4 | — | — | |
| CASS2026.06 | 20.4 | — | 0.7 | |
| ProxyCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 20.3 | — | — | |
| ProxyCLIPExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 20.2 | 42.3 | — | |
| SC-CLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 20.1 | 43.9 | — | |
| CLIP-DINOiserBackbone=CLIP B/162026.04 | 20 | — | — | |
| CLIP-DINOiserVenue=ECCV’24, Backbone (Size)=CLIP + DINO (ViT-B/16), Training Strategy=Training-based2026.06 | 20 | — | — | |
| LPOSS + Pre-tr.Backbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 19.9 | — | — | |
| ProxyCLIPVenue=ECCV’24, Backbone (Size)=CLIP + DINOv2†(ViT-B/14), Training Strategy=Training-free2026.06 | 19.7 | — | — | |
| DIH-CLIPVenue=ICCV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 19.6 | — | — | |
| SFP*Pub. & Year=ICCV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 19.4 | — | — | |
| PEARLExtra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=false2026.03 | 19.4 | — | — | |
| EVA-CLIP + UniRefinerViT=8B/14, Background category=Without background category, Protocol=Zero-shot2026.05 | 19.2 | — | — | |
| NACLIP*Pub. & Year=WACV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 19.1 | — | — | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv3 (ViT-B/16), Training free=✓, Mask Refinement=true2026.03 | 18.9 | — | — | |
| dino.txtExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 18.9 | 31.8 | — | |
| FreeCPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 18.9 | 42.2 | — | |
| PixelCLIP-ViTBackbone=CLIP B/162026.04 | 18.7 | — | — | |
| +CS & AMF (GCLIP)Pub. & Year=Ours, Setting=TF-OVSS2025.02 | 18.5 | — | — | |
| ResCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 18 | 41.2 | — | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 17.9 | — | — | |
| SCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 17.8 | — | — | |
| +CSPub. & Year=Ours, Setting=TF-OVSS2025.02 | 17.8 | — | — | |
| CoDeVenue=CVPR’24, Backbone (Size)=CLIP, Training Strategy=Training-based2026.06 | 17.7 | — | — | |
| NACLIPVenue=WACV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 17.4 | — | — | |
| CdamCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 17.2 | — | — | |
| TCLPub. & Year=CVPR’23, Extra data=CC3M+CC12M, Extra backbone=✗, Training free=✗, Mask Refinement=true2026.03 | 17.1 | — | — | |
| SAM-CLIPVenue=CVPR’24, Backbone (Size)=CLIP + SAM (ViT-B/16), Training Strategy=Training-based2026.06 | 17.1 | — | — | |
| SPARBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 17 | — | — | |
| CLIPtrasePub. & Year=ECCV’24, Setting=TF-OVSS2025.02 | 17 | — | — | |
| Pre-trainedBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 16.8 | — | — | |
| ClearCLIPPub. & Year=ECCV’24, Setting=TF-OVSS2025.02 | 16.7 | — | — | |
| ClearCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 16.7 | 38.1 | — | |
| ClearCLIPVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 16.7 | — | — | |
| CLIPtraseVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 16.4 | — | — | |
| SigLIPv2ViT=So/16, Background category=Without background category, Protocol=Zero-shot2026.05 | 16.3 | — | — | |
| NaFlexBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 16.2 | — | — | |
| SPARBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 16.2 | — | — | |
| CLIPViT=G/14, Background category=Without background category, Protocol=Zero-shot2026.05 | 16.2 | — | — | |
| SCLIPPub. & Year=ECCV’24, Setting=TF-OVSS2025.02 | 16.1 | — | — | |
| SCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 16.1 | 38.2 | — | |
| SCLIPVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 16.1 | — | — | |
| LaVGPub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv1 (ViT-B/8), Training free=✓, Mask Refinement=true2026.03 | 15.8 | — | — | |
| LaVGVenue=ECCV’24, Backbone (Size)=CLIP + DINO (ViT-B/8), Training Strategy=Training-free2026.06 | 15.8 | — | — | |
| GEM‡Pub. & Year=CVPR’24, Setting=TF-OVSS2025.02 | 15.7 | — | — | |
| Pre-trainedBackbone=OpenCLIP - ViT-B-16, Inference=sliding-window, Upsampler=bilinear2026.04 | 15.4 | — | — | |
| TCLBackbone=CLIP B/162026.04 | 14.9 | — | — | |
| TCLPub. & Year=CVPR’23, Setting=T-OVSS2025.02 | 14.9 | — | — | |
| TCLVenue=CVPR’23, Backbone (Size)=CLIP, Training Strategy=Training-based2026.06 | 14.9 | — | — | |
| Pre-trainedBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 14.8 | — | — | |
| LaVGExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 14.8 | 38.2 | — | |
| ReCLIPPub. & Year=CVPR’24, Setting=USS2025.02 | 14.3 | — | — | |
| CoDeBackbone=CLIP B/162026.04 | 12.9 | — | — | |
| ReCoPub. & Year=NeurIPS’22, Extra data=ImageNet-1K, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 12.4 | — | — | |
| MaskCLIP+†Pub. & Year=ECCV’22, Setting=USS2025.02 | 12.2 | — | — | |
| EVA-CLIPViT=8B/14, Background category=Without background category, Protocol=Zero-shot2026.05 | 11.7 | — | — | |
| Pre-trainedBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 11.5 | — | — | |
| ReCoBackbone=CLIP B/162026.04 | 11.2 | — | — | |
| CoCuPub. & Year=NeurIPS’24, Setting=T-OVSS2025.02 | 11.1 | — | — | |
| MaskCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 9.8 | 27.9 | — |