Open Vocabulary Semantic Segmentation on COCO-Stuff
44.4mIoUActiveSAM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ActiveSAMVenue=Ours, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 44.4 | — | — | |
| ActiveSAM2026.06 | 44.4 | 1.66 | — | |
| SegEarth-OV3Venue=arXiv’25, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 42.8 | — | — | |
| SegEarth-OV32026.06 | 42.8 | 0.31 | — | |
| OVS-DINOBackbone=DINOv2 B/142026.04 | 34.2 | — | — | |
| CorrCLIPVenue=ICCV’25, Backbone (Size)=CLIP + †, Training Strategy=Training-free2026.06 | 34 | — | — | |
| ReMEVenue=ICCV’25, Backbone (Size)=CLIP + §, Training Strategy=Training-free2026.06 | 33.3 | — | — | |
| SAM 3Venue=ICLR’26, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 33.3 | — | — | |
| SAM^32026.06 | 33.3 | 0.11 | — | |
| SAM-CLIPVenue=CVPR’24, Backbone (Size)=CLIP + SAM (ViT-B/16), Training Strategy=Training-based2026.06 | 31.5 | — | — | |
| Talk2DINOVenue=ICCV’25, Backbone (Size)=CLIP + DINOv2†(ViT-B/14), Training Strategy=Training-based2026.06 | 30.2 | — | — | |
| TridentVenue=ICCV’25, Backbone (Size)=CLIP + ‡, Training Strategy=Training-free2026.06 | 28.3 | — | — | |
| Talk2DINOBackbone=DINOv2 B/142026.04 | 28.1 | — | — | |
| LoftUp2026.06 | 27.54 | — | 48.38 | |
| RF-CLIPVenue=AAAI’26, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 27.5 | — | — | |
| AnyUp2026.06 | 27.3 | — | 48.62 | |
| JAFAR2026.06 | 27.13 | — | 48.47 | |
| RaysUp2026.06 | 27.11 | — | 48.57 | |
| FreeDAPub. & Year=CVPR’24, Extra data=COCO Captions, Extra backbone=DINOv2 (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 27.1 | — | — | |
| CASSVenue=CVPR’25, Backbone (Size)=CLIP + DINO (ViT-B/8), Training Strategy=Training-free2026.06 | 26.7 | — | — | |
| DIH-CLIPVenue=ICCV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 26.7 | — | — | |
| CASS2026.06 | 26.7 | 0.63 | — | |
| FeatUp2026.06 | 26.67 | — | 48.13 | |
| ProxyCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 26.6 | — | — | |
| SFPVenue=ICCV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 26.4 | — | — | |
| PEARLExtra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=false2026.03 | 26.3 | — | — | |
| SFP*Pub. & Year=ICCV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 25.9 | — | — | |
| LPOSSVenue=CVPR’25, Backbone (Size)=CLIP + DINO (ViT-B/16), Training Strategy=Training-free2026.06 | 25.9 | — | — | |
| Bilinear2026.06 | 25.73 | — | 47.91 | |
| NACLIP*Pub. & Year=WACV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 25.7 | — | — | |
| DSGSBackbone=CLIP B/162026.04 | 25.7 | — | — | |
| FreeDAVenue=CVPR’24, Backbone (Size)=CLIP + DINOv2 (ViT-B/14), Training Strategy=Training-free2026.06 | 25.7 | — | — | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv3 (ViT-B/16), Training free=✓, Mask Refinement=true2026.03 | 25.6 | — | — | |
| ProxyCLIPVenue=ECCV’24, Backbone (Size)=CLIP + DINOv2†(ViT-B/14), Training Strategy=Training-free2026.06 | 25.4 | — | — | |
| CLIP-DINOiserPub. & Year=ECCV’24, Extra data=ImageNet-1K, Extra backbone=DINOv1 (ViT-B/16), Training free=✗, Mask Refinement=true2026.03 | 25.3 | — | — | |
| +CS & AMF (GCLIP)Pub. & Year=Ours, Setting=TF-OVSS2025.02 | 24.8 | — | — | |
| CLIP-DINOiserParadigm=Use Frozen CLIP, Background Prompt=No, Protocol=Rerun (*)2026.01 | 24.6 | — | — | |
| CLIP-DINOiserBackbone=CLIP B/162026.04 | 24.6 | — | — | |
| CLIP-DINOiserVenue=ECCV’24, Backbone (Size)=CLIP + DINO (ViT-B/16), Training Strategy=Training-based2026.06 | 24.6 | — | — | |
| CLIPtrasePub. & Year=ECCV’24, Setting=TF-OVSS2025.02 | 24.1 | — | — | |
| INSIGHT_thresParadigm=Use Frozen CLIP with Interpretability, Background Prompt=No2026.01 | 24 | — | — | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 24 | — | — | |
| +CSPub. & Year=Ours, Setting=TF-OVSS2025.02 | 24 | — | — | |
| SCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 23.9 | — | — | |
| ClearCLIPPub. & Year=ECCV’24, Setting=TF-OVSS2025.02 | 23.9 | — | — | |
| CoDeVenue=CVPR’24, Backbone (Size)=CLIP, Training Strategy=Training-based2026.06 | 23.9 | — | — | |
| ClearCLIPVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 23.9 | — | — | |
| GEM‡Pub. & Year=CVPR’24, Setting=TF-OVSS2025.02 | 23.7 | — | — | |
| PixelCLIP-ViTBackbone=CLIP B/162026.04 | 23.6 | — | — | |
| SynSegBackbone=CLIP B/162026.04 | 23.6 | — | — | |
| NACLIPVenue=WACV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 23.3 | — | — | |
| LaVGPub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv1 (ViT-B/8), Training free=✓, Mask Refinement=true2026.03 | 23.2 | — | — | |
| LaVGVenue=ECCV’24, Backbone (Size)=CLIP + DINO (ViT-B/8), Training Strategy=Training-free2026.06 | 23.2 | — | — | |
| CLIPtraseVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 22.8 | — | — | |
| INSIGHTParadigm=Use Frozen CLIP with Interpretability, Background Prompt=No2026.01 | 22.6 | — | — | |
| TCLPub. & Year=CVPR’23, Extra data=CC3M+CC12M, Extra backbone=✗, Training free=✗, Mask Refinement=true2026.03 | 22.4 | — | — | |
| SCLIPPub. & Year=ECCV’24, Setting=TF-OVSS2025.02 | 22.4 | — | — | |
| SCLIPVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 22.4 | — | — | |
| CLIPSurgeryPub. & Year=Arxiv’23, Setting=TF-OVSS2025.02 | 21.9 | — | — | |
| dino.txtBackbone=DINOv2 L/142026.04 | 20.9 | — | — | |
| ReCLIPPub. & Year=CVPR’24, Setting=USS2025.02 | 20.3 | — | — | |
| TCLParadigm=Text/image alignment training with captions, Background Prompt=No2026.01 | 19.6 | — | — | |
| TCLBackbone=CLIP B/162026.04 | 19.6 | — | — | |
| TCLPub. & Year=CVPR’23, Setting=T-OVSS2025.02 | 19.6 | — | — | |
| TCLVenue=CVPR’23, Backbone (Size)=CLIP, Training Strategy=Training-based2026.06 | 19.6 | — | — | |
| MaskCLIP+†Pub. & Year=ECCV’22, Setting=USS2025.02 | 19.5 | — | — | |
| MaskCLIPParadigm=Use Frozen CLIP, Extra Backbones=ref[9], Background Prompt=No2026.01 | 18.6 | — | — | |
| MaskCLIPParadigm=Use Frozen CLIP, Background Prompt=No2026.01 | 17.6 | — | — | |
| CoDeBackbone=CLIP B/162026.04 | 17.6 | — | — | |
| ReCoPub. & Year=NeurIPS’22, Extra data=ImageNet-1K, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 16.3 | — | — | |
| GEMVenue=CVPR’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 15.7 | — | — | |
| GroupViTPub. & Year=CVPR’22, Extra data=CC12M+RedCaps, Extra backbone=✗, Training free=✗, Mask Refinement=true2026.03 | 15.4 | — | — | |
| GroupViTParadigm=Text/image alignment training with captions, Background Prompt=No2026.01 | 15.3 | — | — | |
| GroupViTBackbone=CLIP S/162026.04 | 15.3 | — | — | |
| GroupViT‡Pub. & Year=CVPR’22, Setting=T-OVSS2025.02 | 15.3 | — | — | |
| GroupViTVenue=CVPR’22, Backbone (Size)=GroupViT (ViT-S/16), Training Strategy=Training-based2026.06 | 15.3 | — | — | |
| MaskCLIPPub. & Year=ECCV’22, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 15.1 | — | — | |
| ReCoParadigm=Build prototypes per class, Background Prompt=No2026.01 | 14.8 | — | — | |
| ReCoBackbone=CLIP B/162026.04 | 14.8 | — | — | |
| CoCuPub. & Year=NeurIPS’24, Setting=T-OVSS2025.02 | 13.6 | — | — | |
| MaskCLIP†Pub. & Year=ECCV’22, Setting=TF-OVSS2025.02 | 13.6 | — | — | |
| CLIP-DIYParadigm=Use Frozen CLIP, Extra Backbones=DINO, Background Prompt=No2026.01 | 13.3 | — | — | |
| CLIPVenue=ICML’21, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 7.2 | — | — | |
| CLIP‡Pub. & Year=ICML’21, Setting=TF-OVSS2025.02 | 4.4 | — | — |