Open-Vocabulary Semantic Segmentation on PC-459
24.1mIoUMROVSeg
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MROVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 24.1 | — | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 23.8 | — | |
| SMARTVLM=CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.12 | 23.6 | — | |
| MAFTP w/ MaskAdapterVLM=CLIP ConvNeXt-L, Training Dataset=COCO-Stuff2024.12 | 22.7 | — | |
| SEDVLM=CLIP ConvNeXt-L, Training Dataset=COCO-Stuff2024.12 | 22.1 | — | |
| MAFT+semBackbone=ConvNeXt-L2026.03 | 21.6 | — | |
| MAFTPVLM=CLIP ConvNeXt-L, Training Dataset=COCO-Stuff2024.12 | 21.2 | — | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 21 | — | |
| CAT-SegPrompt Tuning=MMRL+VaMP2025.11 | 20.3 | — | |
| MAFT+panBackbone=ConvNeXt-L2026.03 | 19.8 | — | |
| FC-CLIP w/ MaskAdapterVLM=CLIP ConvNeXt-L, Training Dataset=COCO Panoptic2024.12 | 19.3 | — | |
| OVRBackbone=ConvNeXt-L2026.03 | 19.1 | — | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 19 | — | |
| CAT-SegPrompt Tuning=-2025.11 | 19 | — | |
| CAT-SegPrompt Tuning=MMRL2025.11 | 18.7 | — | |
| SEDVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2024.12 | 18.6 | — | |
| MAFTPVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2024.12 | 18.5 | — | |
| GBAVLM=CLIP ConvNeXt-L, Training Dataset=COCO Panoptic2024.12 | 18.5 | — | |
| FC-CLIPVLM=CLIP ConvNeXt-L, Training Dataset=COCO Panoptic2024.12 | 18.2 | — | |
| FC-CLIP*Backbone=ConvNeXt-L2026.03 | 18.2 | — | |
| OVRCOATBackbone=ConvNeXt-L2026.03 | 18.1 | — | |
| MAFTP w/ MaskAdapterVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2024.12 | 17.9 | — | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 17.3 | — | |
| SCAN2023.12 | 16.7 | 17.2 | |
| SAN2023.12 | 15.7 | 16.2 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 15.7 | — | |
| SANBackbone=ViT-L2026.03 | 15.7 | — | |
| ODISEVLM=Stable Diffusion, Training Dataset=COCO Panoptic2024.12 | 14.5 | — | |
| ODISEBackbone=ViT-L2026.03 | 14.5 | — | |
| MAFT2023.12 | 12.8 | 13.4 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 12.6 | — | |
| SANPrompt Tuning=-2025.11 | 12.6 | — | |
| OVSeg2023.12 | 12.4 | 12.7 | |
| OvSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.12 | 12.4 | — | |
| OVSegBackbone=ViT-L2026.03 | 12.4 | — | |
| OpenSegVLM=ALIGN, Training Dataset=COCO Panoptic+Loc. Narr.2024.12 | 12.2 | — | |
| OpenSegBackbone=ALIGN2026.03 | 12.2 | — | |
| OvSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 11 | — | |
| OVSegPrompt Tuning=-2025.11 | 11 | — | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 10.4 | — | |
| ZegFormerPrompt Tuning=-2025.11 | 10.4 | — | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.12 | 9.4 | — | |
| SimSeg2023.12 | 8.7 | 9.3 | |
| CoM-PTBackbone=ViT-L/16, PT Method=CoM-PT, Fine-tuning Protocol=SAN [70]2026.04 | 7 | — | |
| CoM-PTBackbone=ViT-B/16, PT Method=CoM-PT, Fine-tuning Protocol=SAN [70]2026.04 | 6.68 | — | |
| BaselineBackbone=ViT-L/16, PT Method=Baseline, Fine-tuning Protocol=SAN [70]2026.04 | 4.47 | — | |
| BaselineBackbone=ViT-B/16, PT Method=Baseline, Fine-tuning Protocol=SAN [70]2026.04 | 1.07 | — |