Open-vocabulary Segmentation on COCO Object
38.7mIoUProxyCLIP*
Evaluation Results
| Method | Links | |
|---|---|---|
| ProxyCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 38.7 | |
| PEARLExtra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=false2026.03 | 37.3 | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv3 (ViT-B/16), Training free=✓, Mask Refinement=true2026.03 | 36.2 | |
| NACLIP*Pub. & Year=WACV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 36.2 | |
| CLIP-DINOiserPub. & Year=ECCV’24, Extra data=ImageNet-1K, Extra backbone=DINOv1 (ViT-B/16), Training free=✗, Mask Refinement=true2026.03 | 36.1 | |
| SFP*Pub. & Year=ICCV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 34.9 | |
| OVDiffParadigm=Build prototypes per class, Extra Backbones=DINO & SD, Background Prompt=Yes2026.01 | 34.8 | |
| CLIP-DINOiserParadigm=Use Frozen CLIP, Background Prompt=Yes, Protocol=Rerun (*)2026.01 | 34.7 | |
| LaVGPub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv1 (ViT-B/8), Training free=✓, Mask Refinement=true2026.03 | 34.2 | |
| INSIGHT_thresParadigm=Use Frozen CLIP with Interpretability, Background Prompt=Yes2026.01 | 33.3 | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 33.3 | |
| SCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 32.1 | |
| CLIPpyParadigm=Text/image alignment training with captions, Background Prompt=Yes2026.01 | 32 | |
| INSIGHTParadigm=Use Frozen CLIP with Interpretability, Background Prompt=Yes2026.01 | 31.8 | |
| TCLPub. & Year=CVPR’23, Extra data=CC3M+CC12M, Extra backbone=✗, Training free=✗, Mask Refinement=true2026.03 | 31.6 | |
| CLIP-DIYParadigm=Use Frozen CLIP, Extra Backbones=DINO, Background Prompt=Yes2026.01 | 31 | |
| TCLVenue=CVPR23, Segmentation Annotation=-, Extra Text pairs=CC3M [48], CC12M [7]2024.08 | 30.4 | |
| TCLParadigm=Text/image alignment training with captions, Background Prompt=Yes2026.01 | 30.4 | |
| GroupViTPub. & Year=CVPR’22, Extra data=CC12M+RedCaps, Extra backbone=✗, Training free=✗, Mask Refinement=true2026.03 | 27.9 | |
| GroupViTParadigm=Text/image alignment training with captions, Background Prompt=Yes2026.01 | 27.5 | |
| SigLIPv2 + UniRefinerViT=So/16, Background category=With background category, Protocol=Zero-shot2026.05 | 26.9 | |
| SegCLIPVenue=ICML23, Segmentation Annotation=COCO [35], Extra Text pairs=CC [48]2024.08 | 26.5 | |
| SegCLIPParadigm=Text/image alignment training with captions, Background Prompt=Yes2026.01 | 26.5 | |
| FreeDAPub. & Year=CVPR’24, Extra data=COCO Captions, Extra backbone=DINOv2 (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 25.8 | |
| ProMaCVenue=Ours, Segmentation Annotation=-, Extra Text pairs=-2024.08 | 25.2 | |
| OVSegmentorVenue=CVPR23, Segmentation Annotation=-, Extra Text pairs=CC12M [7]2024.08 | 25.1 | |
| OVSegmentorParadigm=Text/image alignment training with captions, Background Prompt=Yes2026.01 | 25.1 | |
| EVA-CLIP + UniRefinerViT=8B/14, Background category=With background category, Protocol=Zero-shot2026.05 | 23.8 | |
| ViewCoVenue=ICLR23, Segmentation Annotation=-, Extra Text pairs=CC12M [7], YFCC14M [53]2024.08 | 23.5 | |
| ZeroSegParadigm=Text/image alignment training with captions, Background Prompt=Yes2026.01 | 22.1 | |
| CLIP + UniRefinerViT=G/14, Background category=With background category, Protocol=Zero-shot2026.05 | 21.7 | |
| MaskCLIPParadigm=Use Frozen CLIP, Extra Backbones=ref[9], Background Prompt=Yes2026.01 | 21.6 | |
| SigLIPv2ViT=So/16, Background category=With background category, Protocol=Zero-shot2026.05 | 21.1 | |
| CLIPViT=G/14, Background category=With background category, Protocol=Zero-shot2026.05 | 20.9 | |
| MaskCLIPVenue=ECCV22, Segmentation Annotation=-, Extra Text pairs=-2024.08 | 20.6 | |
| MaskCLIPPub. & Year=ECCV’22, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 18.9 | |
| ReCoPub. & Year=NeurIPS’22, Extra data=ImageNet-1K, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 17.3 | |
| MaskCLIPParadigm=Use Frozen CLIP, Background Prompt=Yes2026.01 | 16.4 | |
| ReCoParadigm=Build prototypes per class, Background Prompt=Yes2026.01 | 15.7 | |
| EVA-CLIPViT=8B/14, Background category=With background category, Protocol=Zero-shot2026.05 | 13.5 |