Semantic Segmentation on Pascal Context 459 classes (val)
21.6mIoUMAFT+
Evaluation Results
| Method | Links | |
|---|---|---|
| MAFT+VLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 21.6 | |
| FC-CLIPtraining dataset=COCO Panoptic2023.08 | 18.2 | |
| FC-CLIPVLM Backbone=ConvNeXt-L, Ensemble Operation=true2024.08 | 18.2 | |
| SANtraining dataset=COCO Stuff [5]2023.08 | 17.1 | |
| MAFTVLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 17 | |
| SAM w/ Mask-AdapterBackbone=SAM-H, Setting=Open-vocabulary2024.12 | 16.8 | |
| SCANVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 16.7 | |
| MAFTVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 16.2 | |
| SANVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 15.7 | |
| SANVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 15.7 | |
| ODISEtraining dataset=COCO Panoptic2023.08 | 14.5 | |
| ODISEVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 14.5 | |
| ODISEVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 14.5 | |
| ODISEtraining dataset=COCO Panoptic + COCO Caption, variant=caption2023.08 | 13.8 | |
| SCANVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 13.2 | |
| MAFTVL-Model=CLIP ViT-B/16, Training Dataset=COCO2023.12 | 12.8 | |
| SAM w/ MAFTBackbone=SAM-H, Setting=Open-vocabulary2024.12 | 12.8 | |
| FC-CLIPVLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 12.7 | |
| SANVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 12.6 | |
| OVSegtraining dataset=COCO Stuff [5]2023.08 | 12.4 | |
| OVSegVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 12.4 | |
| OVSegVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 12.4 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO+Loc. Narr.2023.12 | 12.2 | |
| OpenSegVLM Backbone=ALIGN, Ensemble Operation=false2024.08 | 12.2 | |
| OVSegVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 11 | |
| SimSeg†VL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 10.2 | |
| MaskCLIPtraining dataset=COCO Panoptic2023.08 | 10 | |
| MaskCLIPVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 10 | |
| SimSeg†VL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 9.7 | |
| DeOPBackbone=R101c, Training dataset=COCO-Stuff-156, Decoupled network=true, Number of Passes=12023.04 | 9.4 | |
| OpenSegtraining dataset=COCO Panoptic + COCO Caption2023.08 | 9 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO2023.12 | 9 | |
| SimSegVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 8.7 | |
| OpenSegBackbone=R101, Training dataset=COCO + Loc. Narr., Decoupled network=false, Number of Passes=12023.04 | 7.9 | |
| LSeg+training dataset=COCO Stuff [5]2023.08 | 7.8 | |
| LSeg+VL-Model=ALIGN EN-B7, Training Dataset=COCO2023.12 | 7.8 | |
| SimBaseBackbone=R101c, Training dataset=COCO-Stuff-156, Decoupled network=true, Number of Passes=N'2023.04 | 7 | |
| OpenSegBackbone=R101, Training dataset=COCO, Decoupled network=false, Number of Passes=12023.04 | 6.5 | |
| OpenSegVL-Model=ALIGN RN101, Training Dataset=COCO2023.12 | 6.5 | |
| SAM w/ CLIPBackbone=SAM-H, Setting=Open-vocabulary2024.12 | 6.4 | |
| LSeg+VL-Model=ALIGN RN101, Training Dataset=COCO2023.12 | 5.2 | |
| GroupViTtraining dataset=GCC [75]+YFCC [79]2023.08 | 4.9 |