Semantic Segmentation on PC-59
68.4mIoUDiGSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| DiGSegVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 68.4 | |
| ESC-NetVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 65.6 | |
| HyperCLIPVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 64.2 | |
| DCP-CLIPVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 63.8 | |
| BBNVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 63.7 | |
| CAT-SegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 63.3 | |
| DiGSegVLM=CLIP ViT-B/16, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 62.7 | |
| MaskCLIP++ w/ FC-CLIPCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 62.6 | |
| MaskCLIP++ w/ MAFT+CLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 62.5 | |
| CLIPSelfCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 62.3 | |
| DPSegVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 62.3 | |
| SemLAVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 62.2 | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 62 | |
| CAT-SegVLM=CLIP ViT-L/14, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 62 | |
| OVSNetVLM=CLIP ViT-L/14, Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 62 | |
| SAM 32025.11 | 60.8 | |
| SAM 32025.11 | 60.8 | |
| SEDCLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 60.6 | |
| SEDVLM=ConvNeXt-L, Training dataset=COCO-Stuff2026.03 | 60.6 | |
| SEDVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 60.6 | |
| Mask-AdapterVLM=CLIP ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 60.4 | |
| SANVLM=CLIP ViT-L/14, Training dataset=COCO-Stuff2026.03 | 60.2 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 60.2 | |
| GBAVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 59.6 | |
| MAFT+CLIP arch.=ConvNeXt-L, Training dataset=COCO Stuff2024.12 | 59.4 | |
| MAFT+VLM=ConvNeXt-L, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 59.4 | |
| SCANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 59.3 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 59.3 | |
| SCANVLM=CLIP ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 59.3 | |
| ESC-NetVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 59 | |
| APE-D*training=partially trained on LVIS2025.11 | 58.5 | |
| APE-D2025.11 | 58.5 | |
| HyperCLIPVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 58.5 | |
| FC-CLIPCLIP arch.=ConvNeXt-L, Training dataset=COCO Panoptic2024.12 | 58.4 | |
| SCANVLM=CLIP ViT-B/16, Additional Backbone=Swin-B, Training dataset=COCO-Stuff2026.03 | 58.4 | |
| FC-CLIPVLM=ConvNeXt-L, Training dataset=COCO Panoptic [54]2026.03 | 58.4 | |
| SCANVLM=CLIP ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 58.4 | |
| Mask-AdapterVLM=CLIP ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 58.4 | |
| DPSegVLM=CLIP ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 58.4 | |
| OPMapperVLM=CLIP ViT-B/16, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 58.3 | |
| DCP-CLIPVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 58.1 | |
| USEVLM=CLIP ViT-L/14, Additional Backbone=Swin-B,SAM [41], Training dataset=COCO-Stuff2026.03 | 58 | |
| MasQCLIPCLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 57.8 | |
| SANCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 57.7 | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 57.5 | |
| CAT-SegVLM=CLIP ViT-B/16, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 57.5 | |
| ODISECLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 57.3 | |
| SEDVLM=ConvNeXt-B, Training dataset=COCO-Stuff2026.03 | 57.3 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training dataset=COCO Panoptic [54]2026.03 | 57.3 | |
| SEDVLM=ConvNeXt-B, Backbone=-, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 57.3 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=SAM [41], Training dataset=COCO-Stuff2026.03 | 56.7 | |
| EBSegVLM=CLIP ViT-B/16, Backbone=SAM ViT-B, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 56.7 | |
| OVSegCLIP arch.=ViT-L/14, Training dataset=COCO Stuff2024.12 | 55.7 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training dataset=COCO-Stuff+COCO Caption2026.03 | 55.7 | |
| OVSegVLM=CLIP ViT-L/14, Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.04 | 55.7 | |
| CELVLM=CLIP R50, Training dataset=COCO-Stuff2026.03 | 55.6 | |
| ODISEVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Panoptic, Additional Dataset=No2026.04 | 55.3 | |
| SANVLM=CLIP ViT-B/16, Training dataset=COCO-Stuff2026.03 | 53.8 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff+COCO Caption2026.03 | 53.3 | |
| OVSegVLM=CLIP ViT-B/16, Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.04 | 53.3 | |
| SANVLM=CLIP ViT-L/14, Backbone=Side Adapter, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 51.8 | |
| Seg4DiffVLM=CLIP ViT-L/14, Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.04 | 51.2 | |
| PACLVLM=CLIP ViT-B/16, Training dataset=GCC [50]+YFCC [51]2026.03 | 50.1 | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 49.1 | |
| DeOPVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training dataset=COCO-Stuff-1562026.03 | 48.8 | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=true2026.04 | 48.8 | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 48.8 | |
| OV-StitcherBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 48.6 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7 [60], Training dataset=COCO Panoptic [54]+LOc. Narr. [55]2026.03 | 48.2 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff2026.03 | 47.7 | |
| CorrCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 47.2 | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=true2026.04 | 47.1 | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=false2026.04 | 47.1 | |
| TridentBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 46.1 | |
| MaskCLIPCLIP arch.=ViT-L/14, Training dataset=COCO Panoptic2024.12 | 45.9 | |
| DSLO (solve maximum velocity)Logits Model=CLIP ViT-L/142026.04 | 45.3 | |
| DSLO (solve maximum velocity)Logits Model=CLIP ViT-B/162026.04 | 44.9 | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=false2026.04 | 44.9 | |
| DSLO (solve optimal path)Logits Model=CLIP ViT-L/142026.04 | 44.8 | |
| DSLO (solve optimal path)Logits Model=CLIP ViT-B/162026.04 | 44.4 | |
| FreeDaLogits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 43.1 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training dataset=COCO-Stuff-1562026.03 | 42.8 | |
| TridentBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 42.2 | |
| TridentBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 40.9 | |
| ProxyCLIPBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 40.8 | |
| SC-CLIPLogits Model=CLIP ViT-L/14, Paradigm=M.M.2026.04 | 40.6 | |
| SC-CLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 40.6 | |
| CASSLogits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 40.2 | |
| CASSBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 40.2 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training dataset=COCO Panoptic [54]+LOc. Narr. [55]2026.03 | 40.1 | |
| SC-CLIPLogits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 40.1 | |
| SC-CLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 40.1 | |
| SFPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 39.9 | |
| ProxyCLIP + RAG-OVSVenue=This Paper2025.12 | 39.8 | |
| ProxyCLIPVenue=ECCV'242025.12 | 39.1 | |
| ProxyCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 39.1 | |
| ProxyCLIP‡Logits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 38.8 | |
| ProxyCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 37.7 | |
| ProxyCLIP‡Logits Model=CLIP ViT-L/14, Paradigm=M.M.2026.04 | 37.3 | |
| TIPSv2 L/14Model Scale=L, Patch Size=14, Zero-shot=true2026.04 | 37.1 |