Semantic Segmentation on ADE-847
17.6mIoUCAT-Seg+DeCLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| CAT-Seg+DeCLIPBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 17.6 | |
| CAT-SegBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 16 | |
| CAT-Seg+DeCLIPBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 15.3 | |
| FC-CLIPBackbone=ConvNeXt-L, Training Set=COCO-Panoptic2025.05 | 14.8 | |
| FrozenSegBackbone=ConvNeXt-L, Training Set=COCO-Panoptic2025.05 | 14.8 | |
| SAM 32025.11 | 13.8 | |
| SAM 32025.11 | 13.8 | |
| SANVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 13.7 | |
| SANBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 13.7 | |
| MAFTBackbone=ConvNeXt-L, Training Set=COCO-Stuff2025.05 | 13.1 | |
| SANVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=no2023.02 | 12.4 | |
| SANSupervision Type=Fully-supervised, Annotation=true2024.08 | 12.4 | |
| MAFTSupervision Type=Fully-supervised, Annotation=true2024.08 | 12.1 | |
| CAT-SegBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 12 | |
| ODISESupervision Type=Fully-supervised, Annotation=true2024.08 | 11.1 | |
| ProxyCLIPSupervision Type=Training-free, Annotation=false2024.08 | 11.1 | |
| ODISEBackbone=ViT-L/14, Training Set=COCO-Panoptic2025.05 | 11.1 | |
| SANVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 10.7 | |
| MasQCLIPSupervision Type=Fully-supervised, Annotation=true2024.08 | 10.7 | |
| SANVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=no2023.02 | 10.1 | |
| HIPIESupervision Type=Fully-supervised, Annotation=true2024.08 | 9.7 | |
| X-DecoderSupervision Type=Fully-supervised, Annotation=true2024.08 | 9.2 | |
| APE-D*training=partially trained on LVIS2025.11 | 9.2 | |
| APE-D2025.11 | 9.2 | |
| OvSegVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 9 | |
| OVSegSupervision Type=Fully-supervised, Annotation=true2024.08 | 9 | |
| OVSegBackbone=ViT-L/14, Training Set=COCO-Stuff2025.05 | 9 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO+Loc. Narr., ensemble=no2023.02 | 8.8 | |
| MaskCLIPVL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=no2023.02 | 8.2 | |
| MaskCLIPSupervision Type=Fully-supervised, Annotation=true2024.08 | 8.2 | |
| OvSegVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 7.1 | |
| SimSeg (reproduced)VL-Model=CLIP ViT-L/14, Training Dataset=COCO, ensemble=yes2023.02 | 7.1 | |
| DeOPSupervision Type=Fully-supervised, Annotation=true2024.08 | 7.1 | |
| CLIP-DINOiserSupervision Type=Weakly-supervised, Annotation=false2024.08 | 7.1 | |
| SimSegVL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 7 | |
| ZSsegBackbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 7 | |
| SimSeg (reproduced)VL-Model=CLIP ViT-B/16, Training Dataset=COCO, ensemble=yes2023.02 | 6.9 | |
| OpenSegVL-Model=ALIGN EN-B7, Training Dataset=COCO, ensemble=no2023.02 | 6.3 | |
| ZegFormer+Backbone=ViT-B/16, Training Set=COCO-Stuff2025.05 | 5.6 | |
| TCLSupervision Type=Weakly-supervised, Annotation=false2024.08 | 4.9 | |
| SCLIPSupervision Type=Training-free, Annotation=false2024.08 | 4.9 | |
| OpenSegVL-Model=ALIGN RN101, Training Dataset=COCO, ensemble=no2023.02 | 4 | |
| LSeg+VL-Model=ALIGN EN-B7, Training Dataset=COCO, ensemble=no2023.02 | 3.8 | |
| MaskCLIPSupervision Type=Training-free, Annotation=false2024.08 | 3.6 | |
| GKCSupervision Type=Fully-supervised, Annotation=true2024.08 | 3.5 | |
| LSeg+VL-Model=ALIGN RN101, Training Dataset=COCO, ensemble=no2023.02 | 2.5 | |
| CLIPSupervision Type=Training-free, Annotation=false2024.08 | 0.8 |