Open-vocabulary semantic segmentation on Pascal Context 60
55.4mIoUActiveSAM
Evaluation Results
| Method | Links | |
|---|---|---|
| ActiveSAMVenue=Ours, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 55.4 | |
| SegEarth-OV3Venue=arXiv’25, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 53.4 | |
| SAM 3Venue=ICLR’26, Backbone (Size)=SAM 3 (PE-L+/14), Training Strategy=Training-free2026.06 | 46.1 | |
| CorrCLIPVenue=ICCV’25, Backbone (Size)=CLIP + †, Training Strategy=Training-free2026.06 | 44.9 | |
| ReMEVenue=ICCV’25, Backbone (Size)=CLIP + §, Training Strategy=Training-free2026.06 | 44.6 | |
| TridentVenue=ICCV’25, Backbone (Size)=CLIP + ‡, Training Strategy=Training-free2026.06 | 38.6 | |
| RF-CLIPVenue=AAAI’26, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 37.9 | |
| Talk2DINOVenue=ICCV’25, Backbone (Size)=CLIP + DINOv2†(ViT-B/14), Training Strategy=Training-based2026.06 | 37.7 | |
| SFPVenue=ICCV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 37.2 | |
| SPARBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 37.1 | |
| CASSVenue=CVPR’25, Backbone (Size)=CLIP + DINO (ViT-B/8), Training Strategy=Training-free2026.06 | 36.7 | |
| DIH-CLIPVenue=ICCV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 36 | |
| FreeDAVenue=CVPR’24, Backbone (Size)=CLIP + DINOv2 (ViT-B/14), Training Strategy=Training-free2026.06 | 35.3 | |
| FreeDAPub. & Year=CVPR’24, Extra data=COCO Captions, Extra backbone=DINOv2 (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 35.2 | |
| ProxyCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 35.2 | |
| PEARLExtra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=false2026.03 | 35.1 | |
| NACLIP*Pub. & Year=WACV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 35 | |
| LPOSSVenue=CVPR’25, Backbone (Size)=CLIP + DINO (ViT-B/16), Training Strategy=Training-free2026.06 | 34.6 | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv3 (ViT-B/16), Training free=✓, Mask Refinement=true2026.03 | 34.5 | |
| LPOSS + SPARBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 34.5 | |
| SFP*Pub. & Year=ICCV’25, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 34.3 | |
| SPARBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 33.8 | |
| ProxyCLIPVenue=ECCV’24, Backbone (Size)=CLIP + DINOv2†(ViT-B/14), Training Strategy=Training-free2026.06 | 33.8 | |
| CLIP-DINOiserPub. & Year=ECCV’24, Extra data=ImageNet-1K, Extra backbone=DINOv1 (ViT-B/16), Training free=✗, Mask Refinement=true2026.03 | 33.5 | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓, Mask Refinement=true2026.03 | 32.6 | |
| ClearCLIPVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 32.6 | |
| Pre-trainedBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 32.4 | |
| CLIP-DINOiserVenue=ECCV’24, Backbone (Size)=CLIP + DINO (ViT-B/16), Training Strategy=Training-based2026.06 | 32.4 | |
| NACLIPVenue=WACV’25, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 32.2 | |
| Pre-trainedBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=bilinear2026.04 | 32.1 | |
| Pre-trainedBackbone=DINOv3 - ViT-L-16, Inference=sliding-window, Upsampler=bilinear2026.04 | 31.8 | |
| SPARBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 31.7 | |
| LaVGPub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv1 (ViT-B/8), Training free=✓, Mask Refinement=true2026.03 | 31.6 | |
| SPARBackbone=DINOv3 - ViT-L-16, Inference=single-pass, Upsampler=bilinear2026.04 | 31.6 | |
| LaVGVenue=ECCV’24, Backbone (Size)=CLIP + DINO (ViT-B/8), Training Strategy=Training-free2026.06 | 31.6 | |
| SCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 31.5 | |
| LPOSS + Pre-tr.Backbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 30.9 | |
| Pre-trainedBackbone=SigLIP2 - ViT-B-16, Inference=sliding-window, Upsampler=bilinear2026.04 | 30.7 | |
| CoDeVenue=CVPR’24, Backbone (Size)=CLIP, Training Strategy=Training-based2026.06 | 30.5 | |
| TCLPub. & Year=CVPR’23, Extra data=CC3M+CC12M, Extra backbone=✗, Training free=✗, Mask Refinement=true2026.03 | 30.4 | |
| SCLIPVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 30.4 | |
| Pre-trainedBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 30.1 | |
| CLIPtraseVenue=ECCV’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 29.9 | |
| SigLIPv2 + UniRefinerViT=So/16, Background category=With background category, Protocol=Zero-shot2026.05 | 29.4 | |
| SPARBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 29.2 | |
| SAM-CLIPVenue=CVPR’24, Backbone (Size)=CLIP + SAM (ViT-B/16), Training Strategy=Training-based2026.06 | 29.2 | |
| SPARBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 28.2 | |
| EVA-CLIP + UniRefinerViT=8B/14, Background category=With background category, Protocol=Zero-shot2026.05 | 26.4 | |
| Pre-trainedBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=AnyUp [45]2026.04 | 25.3 | |
| Pre-trainedBackbone=OpenCLIP - ViT-B-16, Inference=sliding-window, Upsampler=bilinear2026.04 | 25.2 | |
| CLIP + UniRefinerViT=G/14, Background category=With background category, Protocol=Zero-shot2026.05 | 25 | |
| SegCLIPVenue=ICML’23, Backbone (Size)=CLIP, Training Strategy=Training-based2026.06 | 24.7 | |
| Pre-trainedBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 24.5 | |
| TCLVenue=CVPR’23, Backbone (Size)=CLIP, Training Strategy=Training-based2026.06 | 24.3 | |
| NaFlexBackbone=SigLIP2 - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 23.7 | |
| CLIPViT=G/14, Background category=With background category, Protocol=Zero-shot2026.05 | 22.9 | |
| MaskCLIPPub. & Year=ECCV’22, Extra data=✗, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 22.6 | |
| ReCoPub. & Year=NeurIPS’22, Extra data=ImageNet-1K, Extra backbone=✗, Training free=✓, Mask Refinement=true2026.03 | 21.9 | |
| SigLIPv2ViT=So/16, Background category=With background category, Protocol=Zero-shot2026.05 | 21.4 | |
| Pre-trainedBackbone=OpenCLIP - ViT-B-16, Inference=single-pass, Upsampler=bilinear2026.04 | 20.3 | |
| GroupViTPub. & Year=CVPR’22, Extra data=CC12M+RedCaps, Extra backbone=✗, Training free=✗, Mask Refinement=true2026.03 | 19 | |
| GroupViTVenue=CVPR’22, Backbone (Size)=GroupViT (ViT-S/16), Training Strategy=Training-based2026.06 | 18.7 | |
| EVA-CLIPViT=8B/14, Background category=With background category, Protocol=Zero-shot2026.05 | 14.1 | |
| CaRVenue=CVPR’24, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 13.6 | |
| CLIPVenue=ICML’21, Backbone (Size)=CLIP, Training Strategy=Training-free2026.06 | 7.8 |