Semantic Segmentation on Pascal Context 59 (val)
59.4mIoUMAFT+
Evaluation Results
| Method | Links | |
|---|---|---|
| MAFT+VLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 59.4 | |
| SCANVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 59.3 | |
| MAFTVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 59 | |
| SCANVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 58.4 | |
| FC-CLIPVLM Backbone=ConvNeXt-L, Ensemble Operation=true2024.08 | 58.4 | |
| SANVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 57.7 | |
| SANVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 57.7 | |
| MAFTVLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 57.5 | |
| ODISEVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 57.3 | |
| ODISEVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 57.3 | |
| UniLSeg-100Additional LMM=false2023.12 | 56.7 | |
| OVSegVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 55.7 | |
| OVSegVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 55.7 | |
| UniLSeg-20Additional LMM=false2023.12 | 54.3 | |
| SANVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 53.8 | |
| MAFTVL-Model=CLIP ViT-B/16, Training Dataset=COCO2023.12 | 53.5 | |
| SAM w/ MAFTBackbone=SAM-H, Setting=Open-vocabulary2024.12 | 53.5 | |
| OVSegVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 53.3 | |
| OVSegAdditional LMM=true2023.12 | 53.3 | |
| SimSeg†VL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 52.2 | |
| SimSeg†VL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 51.9 | |
| SAM w/ Mask-AdapterBackbone=SAM-H, Setting=Open-vocabulary2024.12 | 49.5 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO+Loc. Narr.2023.12 | 48.2 | |
| OpenSegVLM Backbone=ALIGN, Ensemble Operation=false2024.08 | 48.2 | |
| SimSegVL-Model=CLIP VIT-B/16, Training Dataset=COCO2023.12 | 47.7 | |
| SimSegAdditional LMM=true2023.12 | 47.7 | |
| LSeg+VL-Model=ALIGN EN-B7, Training Dataset=COCO2023.12 | 46.5 | |
| MaskCLIPVL-Model=CLIP VIT-L/14, Training Dataset=COCO2023.12 | 45.9 | |
| MaskCLIPAdditional LMM=true2023.12 | 45.9 | |
| GKCAdditional LMM=false2023.12 | 45.2 | |
| FC-CLIPVLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 42.4 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO2023.12 | 42.1 | |
| OpenSegAdditional LMM=true2023.12 | 42.1 | |
| OpenSegVL-Model=ALIGN RN101, Training Dataset=COCO2023.12 | 36.9 | |
| LSeg+VL-Model=ALIGN RN101, Training Dataset=COCO2023.12 | 36 | |
| LSeg+Additional LMM=false2023.12 | 36 | |
| SAM w/ CLIPBackbone=SAM-H, Setting=Open-vocabulary2024.12 | 34.4 | |
| Group-VITVL-Model=rand. init., Training Dataset=CC12M+YFCC2023.12 | 22.4 |