Open Vocabulary Semantic Segmentation on COCO Stuff without background
33.3mIoUVIP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 33.3 | — | |
| CorrCLIPExtra Backbone=DINO+SAM2, Vision Model Configuration=Multi vision models2026.05 | 31.6 | — | |
| SAM-CLIPTrain=true2024.11 | 31.5 | — | |
| SAM-CLIPPub. & Year=CVPR’24, Extra data=Merged-41M, Extra backbone=SAMv1 (ViT-B/16), Training free=✗2026.03 | 31.5 | — | |
| CLIPerExtra Backbone=Stable Diffusion, Vision Model Configuration=Multi vision models2026.05 | 28.6 | — | |
| TridentTrain=false, Backbone=ViT-H/142024.11 | 28.6 | 48.6 | |
| TridentExtra Backbone=DINO+SAM, Vision Model Configuration=Multi vision models2026.05 | 28.3 | — | |
| TridentTrain=false, Backbone=ViT-B/162024.11 | 28.3 | 45.8 | |
| ProxyCLIP + GLA (Best)Train=False, External Model=DINO, DS Hyperparameter=True, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 27.2 | — | |
| FSAExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 27 | — | |
| ProxyCLIP + GLATrain=False, External Model=DINO, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 26.9 | — | |
| ProxyCLIPTrain=false, Backbone=ViT-H/142024.11 | 26.8 | 44.4 | |
| ProxyCLIP + GLATrain=False, External Model=DINO, DS Hyperparameter=False, Image Resize=448, Crop size=336, Stride=112, Rename trick=With rename trick on Background Classes2026.03 | 26.8 | — | |
| CASSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 26.7 | — | |
| CASSTrain=False, External Model=DINO, DS Hyperparameter=True, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 26.7 | — | |
| SC-CLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 26.6 | — | |
| ProxyCLIPExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 26.5 | — | |
| LPOSSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 26.5 | — | |
| ProxyCLIPTrain=false, Backbone=ViT-B/162024.11 | 26.5 | 42.3 | |
| ProxyCLIPTrain=False, External Model=DINO, DS Hyperparameter=False, Image Resize=448, Crop size=336, Stride=112, Rename trick=With rename trick on Background Classes2026.03 | 26.5 | — | |
| SFPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 26.4 | — | |
| PEARLPub. & Year=current, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 26.3 | — | |
| ProxyCLIP + GLATrain=False, External Model=DINO, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 26.3 | — | |
| FreeCPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 26.1 | — | |
| LPOSS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv1 (ViT-B/16), Training free=✓2026.03 | 25.9 | — | |
| ProxyCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓2026.03 | 25.4 | — | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv3 (ViT-B/16), Training free=✓2026.03 | 25.4 | — | |
| DeCLIP2025.05 | 25.3 | — | |
| FreeDAPub. & Year=CVPR’24, Extra data=COCO Captions, Extra backbone=DINOv2 (ViT-B/14), Training free=✓2026.03 | 24.9 | — | |
| FreeCPTrain=False, External Model=None, DS Hyperparameter=True, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 24.9 | — | |
| FOSSILPub. & Year=WACV’24, Extra data=COCO Captions, Extra backbone=✗, Training free=✓2026.03 | 24.8 | — | |
| CdamCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 24.8 | — | |
| ResCLIPTrain=False, External Model=None, DS Hyperparameter=True, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 24.7 | — | |
| ResCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 24.6 | — | |
| CLIP-DINOiserTrain=true2024.11 | 24.6 | 40.3 | |
| CLIP-DINOiser2025.05 | 24.6 | — | |
| CLIP-DINOiserPub. & Year=ECCV’24, Extra data=ImageNet-1K, Extra backbone=DINOv1 (ViT-B/16), Training free=✗2026.03 | 24.6 | — | |
| CLIP-DINOiserTrain=True, External Model=DINO, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 24.6 | — | |
| ClearCLIP + GLATrain=False, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 24.6 | — | |
| DIH-CLIPTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 24.5 | — | |
| SCLIP + GLATrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 24.2 | — | |
| SFP*Pub. & Year=ICCV’25, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 24 | — | |
| ClearCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 23.9 | — | |
| CoDeTrain=true2024.11 | 23.9 | — | |
| ClearCLIP2025.05 | 23.9 | — | |
| CoDePub. & Year=CVPR’24, Extra data=CC3M+RedCaps, Extra backbone=✗, Training free=✗2026.03 | 23.9 | — | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓2026.03 | 23.9 | — | |
| ClearCLIPPub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 23.9 | — | |
| ClearCLIPTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 23.9 | — | |
| TTDTrain=true2024.11 | 23.7 | — | |
| FLOSSTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 23.6 | — | |
| NACLIPTrain=false, Backbone=ViT-B/162024.11 | 23.3 | 39.4 | |
| NACLIP*Pub. & Year=WACV’25, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 23.3 | — | |
| NACLIPTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 23.3 | — | |
| LaVGPub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv1 (ViT-B/8), Training free=✓2026.03 | 23.2 | — | |
| LaVGTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 23.2 | — | |
| LaVGExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 22.8 | — | |
| CLIPtrasePub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 22.8 | — | |
| SCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 22.4 | — | |
| SCLIPTrain=false, Backbone=ViT-B/162024.11 | 22.4 | 38.2 | |
| SCLIP2025.05 | 22.4 | — | |
| SCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 22.4 | — | |
| TCLTrain=True, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 22.4 | — | |
| SCLIPTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 22.4 | — | |
| OVDiffTrain=false, Backbone=ViT-B/162024.11 | 20.3 | 37.8 | |
| TCLTrain=true2024.11 | 19.6 | 33.9 | |
| TCL2025.05 | 19.6 | — | |
| TCLPub. & Year=CVPR’23, Extra data=CC3M+CC12M, Extra backbone=✗, Training free=✗2026.03 | 19.6 | — | |
| dino.txtExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 19.2 | — | |
| PnP-OVSSPub. & Year=CVPR’24, Extra data=✗, Extra backbone=BLIP (ViT-L/16), Training free=✓2026.03 | 17.9 | — | |
| SCLIPTrain=false, Backbone=ViT-H/142024.11 | 16.8 | 29.1 | |
| MaskCLIPTrain=false, Backbone=ViT-B/162024.11 | 16.7 | 30.3 | |
| MaskCLIP2025.05 | 16.7 | — | |
| MaskCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 16.4 | — | |
| MaskCLIPPub. & Year=ECCV’22, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 16.4 | — | |
| GEMPub. & Year=CVPR’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 15.7 | — | |
| GroupViT2025.05 | 15.3 | — | |
| GroupViTPub. & Year=CVPR’22, Extra data=CC12M+RedCaps, Extra backbone=✗, Training free=✗2026.03 | 15.3 | — | |
| GroupViTTrain=True, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 15.3 | — | |
| ReCoTrain=false, Backbone=ViT-B/162024.11 | 14.8 | 23.5 | |
| ReCo2025.05 | 14.8 | — | |
| ReCoPub. & Year=NeurIPS’22, Extra data=ImageNet-1K, Extra backbone=✗, Training free=✓2026.03 | 14.8 | — | |
| ReCoTrain=True, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 14.8 | — | |
| CLIP-DIYTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 13.3 | — | |
| MaskCLIPTrain=false, Backbone=ViT-H/142024.11 | 8.4 | 19.3 | |
| CLIPPub. & Year=ICML’21, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 7.2 | — | |
| CLIP2025.05 | 5.7 | — | |
| CLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 4.4 | — | |
| CLIPTrain=false, Backbone=ViT-B/162024.11 | 4.4 | 11.7 | |
| OpenCLIPTrain=false, Backbone=ViT-H/142024.11 | 3.2 | 7.1 |