Semantic Segmentation on PASCAL Context P-459 (val)
24.9mIoUDiSa
Evaluation Results
| Method | Links | |
|---|---|---|
| DiSaVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 24.9 | |
| CAT-SegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 23.8 | |
| DPSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 23.5 | |
| SEDVLM=ConvNeXt-L, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 22.6 | |
| APE (D)Backbone=ViT-L2023.12 | 21.8 | |
| APE (B)Backbone=ViT-L2023.12 | 21 | |
| EBSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 21 | |
| EBSegVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 21 | |
| DiSaVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 20.3 | |
| APE (C)Backbone=ViT-L2023.12 | 20.1 | |
| DPSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 19.5 | |
| CAT-SegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 19 | |
| SEDVLM=ConvNeXt-B, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 18.6 | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 17.3 | |
| EBSegVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 17.3 | |
| SAN2024.03 | 17.1 | |
| SCANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 16.7 | |
| X-DecoderBackbone=DaViT-L2023.12 | 16.1 | |
| X-DecoderTraining Data=COCO, CC3M, SBU-C, VG, COCO-Caption, (Florence)2023.07 | 16.1 | |
| APE (A)Backbone=ViT-L2023.12 | 15.9 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 15.7 | |
| SANVLM=CLIP ViT-L/14, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 15.7 | |
| ODISE2024.03 | 14.5 | |
| ODISEVLM=SD+CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.06 | 14.5 | |
| ODISEVLM=CLIP ViT-L/14, Additional Backbone=Stable Diffusion, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 14.5 | |
| HIPIE w/ CLIPTraining Data=O365, COCO, RefCOCO, PACO, CLIP2023.07 | 14.4 | |
| PSALMzero-shot=true, additional_training_data=LVIS2024.03 | 14 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 12.6 | |
| SANVLM=CLIP ViT-B/16, Additional Backbone=None, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 12.6 | |
| OVSegBackbone=Swin-B2023.12 | 12.4 | |
| OVSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 12.4 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 12.4 | |
| OpenSegBackbone=ENB72023.12 | 12.2 | |
| HIPIE w/o CLIPTraining Data=O365, COCO, RefCOCO, PACO2023.07 | 12.2 | |
| OpenSegVLM=ALIGN EN-B7, Training Dataset=COCO Panoptic[15]+Loc.Narr.2024.06 | 12.2 | |
| OpenSegVLM=ALIGN, Additional Backbone=Eff-B7, Training Dataset=COCO Panoptic, Additional Dataset=Yes2026.01 | 11.5 | |
| OVSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff+COCO Caption[4]2024.06 | 11 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=Yes2026.01 | 11 | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 10.4 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 10.4 | |
| PSALMzero-shot=true2024.03 | 10.2 | |
| SimSegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff2024.06 | 10.2 | |
| MaskCLIP2024.03 | 10 | |
| MaskCLIPVLM=CLIP ViT-L/14, Training Dataset=COCO Panoptic2024.06 | 10 | |
| MaskCLIPCOCO Training Data=Masks + Labels2022.08 | 10 | |
| SimSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2024.06 | 9.7 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=No2026.01 | 9.1 | |
| MaskCLIP (MaskRCNN)COCO Training Data=Masks + Labels2022.08 | 9.1 | |
| OpenSegCOCO Training Data=Masks + Captions2022.08 | 9 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO Panoptic, Additional Dataset=Yes2026.01 | 7.9 | |
| LSeg+VLM=ALIGN EN-B7, Training Dataset=COCO-Stuff2024.06 | 7.8 | |
| LSeg+COCO Training Data=Masks + Labels2022.08 | 7.8 | |
| OpenSegVLM=ALIGN RN-101, Training Dataset=COCO Panoptic[15]2024.06 | 6.5 | |
| UNINEXTTraining Data=O365, COCO, RefCOCO2023.07 | 5.8 | |
| MaskCLIP w/o RMACOCO Training Data=Masks2022.08 | 5.3 | |
| LSeg+VLM=ALIGN RN-101, Training Dataset=COCO-Stuff2024.06 | 5.2 | |
| LSeg+VLM=ALIGN, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=No2026.01 | 5.2 | |
| CLIP BaselineCOCO Training Data=Masks2022.08 | 5.2 | |
| ALIGN w/ proposalsCOCO Training Data=Masks2022.08 | 4.8 | |
| ALIGNCOCO Training Data=None2022.08 | 3.7 |