Open-vocabulary semantic segmentation on Pascal VOC 20 without background
92.5mIoUVIP
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 92.5 | 52.4 | 100 | 1,650 | |
| CorrCLIPExtra Backbone=DINO+SAM2, Vision Model Configuration=Multi vision models2026.05 | 88.8 | 51 | 1,440 | 3,200 | |
| CASSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 87.8 | 44.4 | 440 | 2,890 | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv3 (ViT-B/16), Training free=✓2026.03 | 87.6 | — | — | — | |
| PEARLPub. & Year=current, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 86.9 | — | — | — | |
| CASS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓2026.03 | 86.1 | — | — | — | |
| CLIPerExtra Backbone=Stable Diffusion, Vision Model Configuration=Multi vision models2026.05 | 86 | 45.3 | 180 | 3,390 | |
| ResCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 85.9 | 41.2 | 85 | 2,550 | |
| TridentExtra Backbone=DINO+SAM, Vision Model Configuration=Multi vision models2026.05 | 84.5 | 45.8 | 120 | 3,710 | |
| dino.txtExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 84.5 | 31.8 | 90 | 1,500 | |
| SFPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 84.5 | 44 | 100 | 1,600 | |
| SC-CLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 84.3 | 43.9 | 85 | 1,600 | |
| SFP*Pub. & Year=ICCV’25, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 83.4 | — | — | — | |
| ProxyCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv2† (ViT-B/14), Training free=✓2026.03 | 83 | — | — | — | |
| LaVGPub. & Year=ECCV’24, Extra data=✗, Extra backbone=DINOv1 (ViT-B/8), Training free=✓2026.03 | 82.5 | — | — | — | |
| FSAExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 82.3 | 43.3 | 110 | 1,650 | |
| LaVGExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 81.9 | 38.2 | 140 | 1,750 | |
| FreeCPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 81.5 | 42.2 | 120 | 750 | |
| CLIPtrasePub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 81 | — | — | — | |
| CLIP-DINOiserPub. & Year=ECCV’24, Extra data=ImageNet-1K, Extra backbone=DINOv1 (ViT-B/16), Training free=✗2026.03 | 80.9 | — | — | — | |
| ClearCLIPPub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 80.9 | — | — | — | |
| ClearCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 80.9 | 38.1 | 45 | 650 | |
| SCLIP*Pub. & Year=ECCV’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 80.4 | — | — | — | |
| SCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 80.4 | 38.2 | 60 | 1,580 | |
| ProxyCLIPExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 80.3 | 42.3 | 105 | 1,600 | |
| GroupViTPub. & Year=CVPR’22, Extra data=CC12M+RedCaps, Extra backbone=✗, Training free=✗2026.03 | 79.7 | — | — | — | |
| NACLIP*Pub. & Year=WACV’25, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 79.7 | — | — | — | |
| LPOSSExtra Backbone=DINO, Vision Model Configuration=Multi vision models2026.05 | 79.3 | 42.1 | — | — | |
| LPOSS*Pub. & Year=CVPR’25, Extra data=✗, Extra backbone=DINOv1 (ViT-B/16), Training free=✓2026.03 | 78.8 | — | — | — | |
| TCLPub. & Year=CVPR’23, Extra data=CC3M+CC12M, Extra backbone=✗, Training free=✗2026.03 | 77.5 | — | — | — | |
| FreeDAPub. & Year=CVPR’24, Extra data=COCO Captions, Extra backbone=DINOv2 (ViT-B/14), Training free=✓2026.03 | 77.1 | — | — | — | |
| MaskCLIPPub. & Year=ECCV’22, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 74.9 | — | — | — | |
| MaskCLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 74.9 | 27.9 | — | — | |
| CaRPub. & Year=CVPR’24, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 73.7 | — | — | — | |
| ReCoPub. & Year=NeurIPS’22, Extra data=ImageNet-1K, Extra backbone=✗, Training free=✓2026.03 | 57.7 | — | — | — | |
| PnP-OVSSPub. & Year=CVPR’24, Extra data=✗, Extra backbone=BLIP (ViT-L/16), Training free=✓2026.03 | 51.3 | — | — | — | |
| CLIPPub. & Year=ICML’21, Extra data=✗, Extra backbone=✗, Training free=✓2026.03 | 49.1 | — | — | — | |
| CLIPExtra Backbone=X, Vision Model Configuration=Single vision model2026.05 | 41.8 | 11.6 | — | — |