Semantic Segmentation on Pascal VOC 20
98.4mIoUPCA-Seg
Evaluation Results
| Method | Links | |
|---|---|---|
| PCA-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 98.4 | |
| DeCLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 97.7 | |
| H-CLIPBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 97.7 | |
| ESC-NetSize=ViT-B/16, Training Approach=Training-based2024.11 | 97.3 | |
| PCA-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 97.3 | |
| CAT-SegVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 97 | |
| CAT-SegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 97 | |
| LLMFormerBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 96.8 | |
| DeCLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 96.6 | |
| MAFT+VLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 96.5 | |
| EBSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff2026.03 | 96.4 | |
| SEDBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 96.1 | |
| Mask-AdapterBackbone=ConvNeXt-L, Training Dataset=COCO-Stuff2026.03 | 95.8 | |
| MAFTP*VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 95.5 | |
| FC-CLIPVLM Backbone=ConvNeXt-L, Ensemble Operation=true2024.08 | 95.4 | |
| H-CLIPBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 95.2 | |
| Mask-AdapterBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 95.1 | |
| MAFTP w/ MaskAdapter (Baseline)VLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 95.1 | |
| SCNVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 95.1 | |
| CAT-SegSize=ViT-B/16, Training Approach=Training-based2024.11 | 94.6 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 94.6 | |
| SANVLM=CLIP ViT-L/14, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 94.6 | |
| SANVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 94.6 | |
| EBSegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 94.6 | |
| CAT-SegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 94.6 | |
| EBSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 94.6 | |
| CAT-SegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 94.6 | |
| OVSegbackbone=Swin-B, training dataset=COCO-Stuff-1712022.10 | 94.5 | |
| OVSegVLM=CLIP ViT-L/14, Additional Backbone=Swin-B, Training Dataset=COCO-Stuff, Additional Dataset=true2023.03 | 94.5 | |
| OVSegVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 94.5 | |
| OVSegBackbone=ViT-L/14, Training Dataset=COCO-Stuff + Caption2026.03 | 94.5 | |
| SEDBackbone=ConvNeXt-B, Training Dataset=COCO-Stuff2026.03 | 94.4 | |
| SEDVLM=CLIP ConvNeXt-B, Training Dataset=COCO-Stuff2026.06 | 94.4 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 94 | |
| SANVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 94 | |
| ZegCLIPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff-156, Additional Dataset=false2023.03 | 93.6 | |
| MAFTVLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 93 | |
| OVSegbackbone=R-101c, training dataset=COCO-Stuff-1712022.10 | 92.6 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Training Dataset=COCO-Stuff, Additional Dataset=true2023.03 | 92.6 | |
| OVSegBackbone=ViT-B/16, Training Dataset=COCO-Stuff + Caption2026.03 | 92.6 | |
| OvSegVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 92.6 | |
| MAFTVLM Backbone=ViT-L, Ensemble Operation=false2024.08 | 92.1 | |
| HyperSeg2026.03 | 92.1 | |
| CorrCLIPSize=ViT-H/14, Training Approach=Training-free2024.11 | 91.8 | |
| DeOPVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 91.7 | |
| CorrCLIPSize=ViT-L/14, Training Approach=Training-free2024.11 | 91.5 | |
| CaRSize=ViT-L/14, Training Approach=Training-free2024.11 | 91.4 | |
| CLIPerSize=ViT-L/14, Training Approach=Training-free2024.11 | 90 | |
| SelfTrainbackbone=Eff-L2, training dataset=Same as test2022.10 | 90 | |
| SELF1E-2Btrained on corresponding datasets=true2026.03 | 89.9 | |
| ZegFormer†VLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 89.5 | |
| FC-CLIPVLM Backbone=ConvNeXt-L, Ensemble Operation=false2024.08 | 89.5 | |
| ZegFormerVLM=CLIP ViT-B/16, Training Dataset=COCO-Stuff2026.06 | 89.5 | |
| OVSegbackbone=R-101c, training dataset=COCO-Stuff-1562022.10 | 89.2 | |
| CorrCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 88.8 | |
| TridentSize=ViT-H/14, Training Approach=Training-free2024.11 | 88.7 | |
| ZSSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff, Additional Dataset=false2023.03 | 88.4 | |
| ZSsegBackbone=ViT-B/16, Training Dataset=COCO-Stuff2026.03 | 88.4 | |
| SC-CLIPSize=ViT-L/14, Training Approach=Training-free2024.11 | 88.3 | |
| FreeDASize=ViT-L/14, Training Approach=Training-free2024.11 | 87.9 | |
| CASSSize=ViT-B/16, Training Approach=Training-free2024.11 | 87.8 | |
| SCLIP + GPUA (DINOv3)Base Framework=SCLIP, Alignment Strategy=GPUA, Visual Foundation Model=DINOv3, Protocol=Zero-shot2026.06 | 87.8 | |
| SC-CLIP + GPUA (DINOv3)Base Framework=SC-CLIP, Alignment Strategy=GPUA, Visual Foundation Model=DINOv3, Protocol=Zero-shot2026.06 | 87.6 | |
| ClearCLIP + ResCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 87.1 | |
| Talk2DINOBase Framework=Talk2DINO, Protocol=Zero-shot2026.06 | 87.1 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Training Dataset=COCO-Stuff-156, Additional Dataset=false2023.03 | 86.2 | |
| ZegFormerBackbone=ViT-B/16, Training Dataset=COCO-Stuff-1562026.03 | 86.2 | |
| ResCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 86 | |
| NACLIP + ResCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 86 | |
| ResCLIPSize=ViT-L/14, Training Approach=Training-free2024.11 | 85.5 | |
| NACLIP + ResCLIPTraining-free=true, Encoder=ViT-L/142024.11 | 85.5 | |
| CLIPerSize=ViT-B/16, Training Approach=Training-free2024.11 | 85.2 | |
| SCLIP + ResCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 84.6 | |
| TridentSize=ViT-B/16, Training Approach=Training-free2024.11 | 84.5 | |
| SC-CLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 84.3 | |
| SC-CLIPBase Framework=SC-CLIP, Protocol=Zero-shot2026.06 | 84.3 | |
| ClearCLIP + ResCLIPTraining-free=true, Encoder=ViT-L/142024.11 | 84.2 | |
| SCLIP + ResCLIPTraining-free=true, Encoder=ViT-L/142024.11 | 83.9 | |
| ProxyCLIPSize=ViT-H/14, Training Approach=Training-free2024.11 | 83.3 | |
| ProxyCLIPBackbone=OpenCLIP-ViT-H/14, Training Strategy=Zero-shot2024.08 | 83.3 | |
| TCLSize=ViT-B/16, Training Approach=Training-based2024.11 | 83.2 | |
| ProxyCLIPSize=ViT-L/14, Training Approach=Training-free2024.11 | 83.2 | |
| ProxyCLIPBackbone=CLIP-ViT-L/14, Training Strategy=Zero-shot2024.08 | 83.2 | |
| GKCBackbone=ViT-B/16, Training Dataset=COCO Panoptic2026.03 | 83.2 | |
| NACLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 83 | |
| ProxyCLIPBase Framework=ProxyCLIP, Protocol=Zero-shot2026.06 | 83 | |
| LaVGSize=ViT-B/16, Training Approach=Training-free2024.11 | 82.5 | |
| LPOSS+Base Framework=LPOSS+, Protocol=Zero-shot2026.06 | 82.5 | |
| HiMTok-8B2026.03 | 82 | |
| SCLIPBase Framework=SCLIP, Protocol=Zero-shot2026.06 | 81.5 | |
| PSALM2026.03 | 81.3 | |
| CLIPtraseSize=ViT-B/16, Training Approach=Training-free2024.11 | 81.2 | |
| CLIP-DINOiserSize=ViT-B/16, Training Approach=Training-based2024.11 | 80.9 | |
| ClearCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 80.9 | |
| ClearCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 80.9 | |
| ZegFormerbackbone=R-50, training dataset=COCO-Stuff-1562022.10 | 80.7 | |
| SCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 80.4 | |
| SCLIPBackbone=CLIP-ViT-B/16, Training Strategy=Zero-shot2024.08 | 80.4 | |
| SCLIPTraining-free=true, Encoder=ViT-B/162024.11 | 80.4 | |
| ProxyCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 80.3 |