Open Vocabulary Semantic Segmentation on COCO Object with background
47.4mIoUVIP
Evaluation Results
| Method | Links | |
|---|---|---|
| VIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 47.4 | |
| CorrCLIPExtra Backbone=DINO+SAM2, Vision Model Configuration=Multi vision models2026.05 | 43.7 | |
| CLIPtrasePub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 43.6 | |
| TridentTrain=false, Backbone=ViT-H/142024.11 | 42.2 | |
| TridentExtra Backbone=DINO+SAM, Vision Model Configuration=Multi vision models2026.05 | 41.1 | |
| TridentTrain=false, Backbone=ViT-B/162024.11 | 41.1 | |
| CLIPerExtra Backbone=Stable Diffusion, Vision Model Configuration=Multi vision models2026.05 | 40 | |
| ProxyCLIPTrain=false, Backbone=ViT-H/142024.11 | 38.6 | |
| FSAExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 38 | |
| SFPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 37.9 | |
| CASSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 37.8 | |
| CASSTrain=False, External Model=DINO, DS Hyperparameter=True, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 37.8 | |
| SC-CLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 37.7 | |
| ProxyCLIP + GLATrain=False, External Model=DINO, DS Hyperparameter=False, Image Resize=448, Crop size=336, Stride=112, Rename trick=With rename trick on Background Classes2026.03 | 37.7 | |
| ProxyCLIP + GLA (Best)Train=False, External Model=DINO, DS Hyperparameter=True, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 37.7 | |
| ProxyCLIP + GLATrain=False, External Model=DINO, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 37.7 | |
| ProxyCLIPExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 37.5 | |
| ProxyCLIPTrain=false, Backbone=ViT-B/162024.11 | 37.5 | |
| ProxyCLIPTrain=False, External Model=DINO, DS Hyperparameter=False, Image Resize=448, Crop size=336, Stride=112, Rename trick=With rename trick on Background Classes2026.03 | 37.5 | |
| TTDTrain=true2024.11 | 37.4 | |
| ProxyCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓2026.03 | 37.4 | |
| DIH-CLIPTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 37.4 | |
| PEARLPub. & Year=current, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 37.3 | |
| ProxyCLIP + GLATrain=False, External Model=DINO, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 37.3 | |
| FreeCPTrain=False, External Model=None, DS Hyperparameter=True, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 37.2 | |
| FreeCPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 36.9 | |
| DeCLIP2025.05 | 36.4 | |
| PnP-OVSSPub. & Year=CVPR’24, Extra data=✗, Extra backbone=BLIP (ViT-L/16), Training free=✓2026.03 | 36.2 | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv3 (ViT-B/16), Training free=✓2026.03 | 36 | |
| CdamCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 35.2 | |
| CLIP-DINOiserTrain=True, External Model=DINO, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 35 | |
| ResCLIPTrain=False, External Model=None, DS Hyperparameter=True, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 35 | |
| CLIP-DINOiserTrain=true2024.11 | 34.8 | |
| CLIP-DINOiser2025.05 | 34.8 | |
| CLIP-DINOiserPub. & Year=ECCV’24, Extra data=ImageNet-1K, Extra backbone=DINOv1 (ViT-B/16), Training free=✗2026.03 | 34.8 | |
| ResCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 34.7 | |
| OVDiffTrain=false, Backbone=ViT-B/162024.11 | 34.6 | |
| ClearCLIP + GLATrain=False, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 34.6 | |
| LPOSSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 34.3 | |
| LaVGPub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv1 (ViT-B/8), Training free=✓2026.03 | 34.2 | |
| LaVGTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 34.2 | |
| LPOSS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv1 (ViT-B/16), Training free=✓2026.03 | 33.4 | |
| LaVGExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 33.3 | |
| NACLIPTrain=false, Backbone=ViT-B/162024.11 | 33.2 | |
| NACLIP*Pub. & Year=WACV’25, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 33.2 | |
| NACLIPTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 33.2 | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓2026.03 | 33.1 | |
| ClearCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 33 | |
| ClearCLIP2025.05 | 33 | |
| ClearCLIPPub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 33 | |
| ClearCLIPTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 33 | |
| SCLIP + GLATrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 32.8 | |
| CoDeTrain=true2024.11 | 32.3 | |
| CoDePub. & Year=CVPR’24, Extra data=CC3M+RedCaps, Extra backbone=✗, Training free=✗2026.03 | 32.3 | |
| SFP*Pub. & Year=ICCV’25, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 32.1 | |
| TCLTrain=True, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 31.6 | |
| CLIP-DIYTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 31 | |
| SCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 30.5 | |
| SCLIPTrain=false, Backbone=ViT-B/162024.11 | 30.5 | |
| SCLIP2025.05 | 30.5 | |
| SCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 30.5 | |
| SCLIPTrain=False, External Model=None, DS Hyperparameter=False, Image Resize=336, Crop size=224, Stride=112, Rename trick=With multiple textual prompts per class2026.03 | 30.5 | |
| TCLTrain=true2024.11 | 30.4 | |
| TCL2025.05 | 30.4 | |
| TCLPub. & Year=CVPR’23, Extra data=CC3M+CC12M, Extra backbone=✗, Training free=✗2026.03 | 30.4 | |
| GroupViT2025.05 | 27.5 | |
| GroupViTPub. & Year=CVPR’22, Extra data=CC12M+RedCaps, Extra backbone=✗, Training free=✗2026.03 | 27.5 | |
| GroupViTTrain=True, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 27.5 | |
| OVSeg2025.05 | 25.1 | |
| SCLIPTrain=false, Backbone=ViT-H/142024.11 | 24.6 | |
| FreeDAPub. & Year=CVPR’24, Extra data=COCO Captions, Extra backbone=DINOv2 (ViT-B/14), Training free=✓2026.03 | 24.4 | |
| dino.txtExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 24.2 | |
| MaskCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 20.6 | |
| MaskCLIPTrain=false, Backbone=ViT-B/162024.11 | 20.6 | |
| MaskCLIP2025.05 | 20.6 | |
| MaskCLIPPub. & Year=ECCV’22, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 20.6 | |
| MaskCLIPTrain=false, Backbone=ViT-H/142024.11 | 16.2 | |
| ReCoTrain=false, Backbone=ViT-B/162024.11 | 15.7 | |
| ReCo2025.05 | 15.7 | |
| ReCoPub. & Year=NeurIPS’22, Extra data=ImageNet-1K, Extra backbone=✗, Training free=✓2026.03 | 15.7 | |
| ReCoTrain=True, External Model=None, DS Hyperparameter=False, Image Resize=448, Crop size=448, Stride=224, Rename trick=None2026.03 | 15.7 | |
| CaRPub. & Year=CVPR’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 15.4 | |
| CLIP2025.05 | 8.1 | |
| CLIPPub. & Year=ICML’21, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 6.5 | |
| CLIPTrain=false, Backbone=ViT-B/162024.11 | 5.6 | |
| CLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 5.5 | |
| OpenCLIPTrain=false, Backbone=ViT-H/142024.11 | 5.3 |