Open Vocabulary Semantic Segmentation on ADE20K A-150
53.99mIoUOracle
Evaluation Results
| Method | Links | |
|---|---|---|
| Oracleevaluation protocol=oracle2025.03 | 53.99 | |
| dinov3.segVariant=Large, Backbone=dinov3.txt2026.03 | 42.19 | |
| ESC-NetVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 41.8 | |
| ESCNetVenue=CVPR’25, Variant=Large2026.03 | 41.8 | |
| DEDOSVenue=ICCV’25, Variant=Large2026.03 | 39.4 | |
| SAM3Venue=ICLR’26, Variant=Large2026.03 | 39 | |
| H-CLIPVenue=CVPR’25, Variant=Large2026.03 | 38.4 | |
| MAFTP w/ MaskAdapterVLM=CLIP ConvNeXt-L, Training Dataset=COCO-Stuff2024.12 | 38.2 | |
| HyperCLIPVenue=CVPR’25, Variant=Large2026.03 | 38.2 | |
| SemLAfusion strategy=LoRA merging, tau=0.05, K=5, evaluation protocol=leave-one-out2025.03 | 38.18 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 37.9 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 37.9 | |
| CAT-SegVenue=CVPR’24, Variant=Large2026.03 | 37.9 | |
| CAT-Segevaluation protocol=zero-shot2025.03 | 37.83 | |
| SemLAfusion strategy=Late Fusion2025.03 | 37.28 | |
| Uniform mergingfusion strategy=LoRA merging2025.03 | 37.25 | |
| USEVLM=CLIP ViT-L/14, Additional Backbone=DINOv2, SAM, Training Dataset=COCO-Stuff, Additional Dataset=true2024.11 | 37.1 | |
| DPSegVenue=CVPR’25, Variant=Large2026.03 | 37.1 | |
| OVSNetVenue=ICCV’25, Variant=Large2026.03 | 37.1 | |
| MROVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 36.9 | |
| SMARTVLM=CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.12 | 36.8 | |
| FC-CLIP w/ MaskAdapterVLM=CLIP ConvNeXt-L, Training Dataset=COCO Panoptic2024.12 | 36.6 | |
| MAFTPVLM=CLIP ConvNeXt-L, Training Dataset=COCO-Stuff2024.12 | 36.3 | |
| MAFT+VLM=ConvNeXt-L, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 36.1 | |
| MAFT+Venue=ECCV’24, Variant=Large2026.03 | 36.1 | |
| Uniformfusion strategy=Late Fusion2025.03 | 36.04 | |
| GBAVLM=CLIP ConvNeXt-L, Training Dataset=COCO Panoptic2024.12 | 35.9 | |
| MAFTP w/ MaskAdapterVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2024.12 | 35.6 | |
| ESC-NetVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 35.6 | |
| SEDVLM=CLIP ConvNeXt-L, Training Dataset=COCO-Stuff2024.12 | 35.3 | |
| SEDVLM=ConvNeXt-L, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 35.2 | |
| SEDVenue=CVPR’24, Variant=Large2026.03 | 35.2 | |
| MAFTPVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2024.12 | 34.5 | |
| FC-CLIPVLM=CLIP ConvNeXt-L, Training Dataset=COCO Panoptic2024.12 | 34.1 | |
| FC-CLIPVenue=NeurIPS’23, Variant=Large2026.03 | 34.1 | |
| SCANVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 33.5 | |
| SCANVenue=CVPR’24, Variant=Large2026.03 | 33.5 | |
| MAFTVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 33 | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 32.8 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 32.8 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 32.1 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 32.1 | |
| SANVenue=CVPR’23, Variant=Large2026.03 | 32.1 | |
| EOV-SegVenue=AAAI’25, Variant=Large2026.03 | 32.1 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 31.8 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 31.8 | |
| HyperCLIPVLM=CLIP ViT-B/16, Fine-tuning Space=H2026.05 | 31.7 | |
| SEDVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2024.12 | 31.6 | |
| SEDVLM=ConvNeXt-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 31.6 | |
| SEDVLM=CLIP ConvNeXt-B, Fine-tuning Space=E2026.05 | 31.6 | |
| HyRoVLM=CLIP ViT-B/16, Fine-tuning Space=H2026.05 | 31.2 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 30.8 | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 30 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 30 | |
| ODISEVLM=Stable Diffusion, Training Dataset=COCO Panoptic2024.12 | 29.9 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 29.9 | |
| ODISEVenue=CVPR’23, Variant=Large2026.03 | 29.9 | |
| OvSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 29.6 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=true2024.11 | 29.6 | |
| OVSegVenue=CVPR’23, Variant=Large2026.03 | 29.6 | |
| OpenSegVLM=ALIGN, Training Dataset=COCO Panoptic+Loc. Narr.2024.12 | 28.6 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 27.5 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 27.5 | |
| SANVLM=CLIP ViT-B/16, Additional Backbone=Side Adapter, Fine-tuning Space=E2026.05 | 27.5 | |
| FC-CLIPVLM=ConvNeXt-L, Training Dataset=COCO Panoptic, Additional Dataset=false2024.11 | 26.6 | |
| OpenSegVLM=ALIGN, Additional Backbone=EfficientNet-B7, Training Dataset=COCO Panoptic, Additional Dataset=true2024.11 | 26.4 | |
| OvSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 24.8 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=true2024.11 | 24.8 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Fine-tuning Space=E2026.05 | 24.8 | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 22.9 | |
| DeOPVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training Dataset=COCO-Stuff-156, Additional Dataset=false2024.11 | 22.9 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 20.5 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 20.5 | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 18 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=true2024.11 | 17.5 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 17.5 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2024.11 | 16.9 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 16.9 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2024.11 | 13 |