Open-Vocabulary Semantic Segmentation on PASCAL Context 59 (val)
65.7mIoUDEDOS
Evaluation Results
| Method | Links | |
|---|---|---|
| DEDOSVenue=ICCV’25, Variant=Large2026.03 | 65.7 | |
| ESCNetVenue=CVPR’25, Variant=Large2026.03 | 65.6 | |
| dinov3.segVariant=Large, Backbone=dinov3.txt2026.03 | 64.27 | |
| HyperCLIPVenue=CVPR’25, Variant=Large2026.03 | 64.2 | |
| H-CLIPVenue=CVPR’25, Variant=Large2026.03 | 64.1 | |
| CAT-SegVenue=CVPR’24, Variant=Large2026.03 | 63.3 | |
| CONCEPTBANKBackbone (Size)=SAM3 (PE-L+/14), Optimization protocol=Parameter-free2026.02 | 63 | |
| DPSegVenue=CVPR’25, Variant=Large2026.03 | 62.3 | |
| OVSNetVenue=ICCV’25, Variant=Large2026.03 | 62 | |
| SAM3Venue=ICLR’26, Variant=Large2026.03 | 60.8 | |
| SEDVenue=CVPR’24, Variant=Large2026.03 | 60.6 | |
| MAFT+Venue=ECCV’24, Variant=Large2026.03 | 59.4 | |
| SCANVenue=CVPR’24, Variant=Large2026.03 | 59.3 | |
| FC-CLIPVenue=NeurIPS’23, Variant=Large2026.03 | 58.4 | |
| SANVenue=CVPR’23, Variant=Large2026.03 | 57.7 | |
| ODISEVenue=CVPR’23, Variant=Large2026.03 | 57.3 | |
| EOV-SegVenue=AAAI’25, Variant=Large2026.03 | 56.9 | |
| OVSegVenue=CVPR’23, Variant=Large2026.03 | 55.7 | |
| ReMEBackbone (Size)=CLIP + DINOv2 (ViT-L/14) + SAM (ViT-L/16), Optimization protocol=Parameter-free2026.02 | 53.1 | |
| CorrCLIPBackbone (Size)=CLIP (ViT-L/14) + DINO (ViT-B/8) + SAM2 (Hiera-L), Optimization protocol=Parameter-free2026.02 | 50.8 | |
| SAM3Backbone (Size)=SAM3 (PE-L+/14), Optimization protocol=Parameter-free2026.02 | 50 | |
| Talk2DINOBackbone (Size)=CLIP + DINOv2 with registers (ViT-B/14), Optimization protocol=Training-based2026.02 | 42.4 | |
| TridentBackbone (Size)=CLIP + DINO (ViT-B/16) + SAM (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 42.2 | |
| RF-CLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 41.4 | |
| CASSBackbone (Size)=CLIP + DINO (ViT-B/8), Optimization protocol=Parameter-free2026.02 | 40.2 | |
| SFPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 39.9 | |
| FreeDABackbone (Size)=CLIP + DINOv2 (ViT-B/14), Optimization protocol=Parameter-free2026.02 | 39.7 | |
| DIH-CLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 39.7 | |
| LPOSSBackbone (Size)=CLIP + DINO (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 37.8 | |
| ClearCLIPUpsampling=SimFeatUp2024.10 | 37.5 | |
| CLIPixtraining=false2026.07 | 37.4 | |
| ProxyCLIPBackbone (Size)=CLIP + DINOv2 with registers (ViT-B/14), Optimization protocol=Parameter-free2026.02 | 37.2 | |
| ResCLIPtraining=false2026.07 | 36.8 | |
| ClearCLIPUpsampling=Original2024.10 | 35.9 | |
| CLIP-DINOiserBackbone (Size)=CLIP + DINO (ViT-B/16), Optimization protocol=Training-based2026.02 | 35.9 | |
| ClearCLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 35.9 | |
| CLIP-DINOisertraining=true2026.07 | 35.9 | |
| ClearCLIPtraining=false2026.07 | 35.9 | |
| NACLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 35.2 | |
| LaVGBackbone (Size)=CLIP + DINO (ViT-B/8), Optimization protocol=Parameter-free2026.02 | 34.7 | |
| SCLIPtraining=false2026.07 | 34.2 | |
| SCLIPUpsampling=SimFeatUp2024.10 | 34.1 | |
| SCLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 34.1 | |
| CLIPtraseBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 33.8 | |
| SCLIPUpsampling=Original2024.10 | 33 | |
| GEMBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 32.6 | |
| TCLUpsampling=Original2024.10 | 30.3 | |
| TCLBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Training-based2026.02 | 30.3 | |
| TCLtraining=true2026.07 | 30.3 | |
| MaskCLIPUpsampling=SimFeatUp2024.10 | 28.7 | |
| MaskCLIPUpsampling=Original2024.10 | 26.4 | |
| GroupViTBackbone (Size)=GroupViT (ViT-S/16), Optimization protocol=Training-based2026.02 | 23.4 | |
| GroupViTtraining=true2026.07 | 23.4 | |
| RecoUpsampling=Original2024.10 | 22.3 | |
| CaRBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 18.4 | |
| CLIPBackbone (Size)=CLIP (ViT-B/16), Optimization protocol=Parameter-free2026.02 | 11.2 | |
| CLIPtraining=false2026.07 | 4.5 |