Semantic Segmentation on PascalVOC
94.5mIoUOVSeg
Evaluation Results
| Method | Links | |
|---|---|---|
| OVSegEncoder=ViT-B/16, Model=CLIP, Pretraining=COCO-Stuff-171, Annotation=UM, Localization Annotation=true, Localization Fine-tuning=true2023.12 | 94.5 | |
| DeepLabV32026.04 | 85.7 | |
| RADIOv2.5-Hevaluation_protocol=linear probing2025.12 | 85.65 | |
| RADIOv2.5-Levaluation_protocol=linear probing2025.12 | 84.83 | |
| Lorentz (DeepLab-R101)Backbone=R1012026.04 | 84.8 | |
| AMoEevaluation_protocol=linear probing2025.12 | 84.4 | |
| CLIP-ESEncoder=ResNet101, Model=CLIP, Pretraining=COCO-Stuff-171, Annotation=IC, Localization Annotation=true, Localization Fine-tuning=true2023.12 | 75 | |
| PACLEncoder=ViT-B/16, Model=CLIP, Pretraining=WIT-400M +CC12M, YFCC, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=true2023.12 | 72.3 | |
| OpenSegEncoder=ENet-B7+FPN, Model=ALIGN, Pretraining=COCO, Loc. Narr, Annotation=IT, UM, Localization Annotation=true, Localization Fine-tuning=true2023.12 | 72.2 | |
| OVSegmentorEncoder=ViT-B/16, Model=DINO, Pretraining=GCC, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=true2023.12 | 53.8 | |
| SegCLIPEncoder=ViT-B/16, Model=CLIP, Pretraining=CC, COCOcap, Annotation=IT, ICap, Localization Annotation=false, Localization Fine-tuning=true2023.12 | 52.6 | |
| GroupViTEncoder=ViT-S/16, Model=scratch, Pretraining=GCC+YFCC, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=true2023.12 | 52.3 | |
| GEMEncoder=ViT-B/16, Model=MetaCLIP, Pretraining=metaclip-400M, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=false2023.12 | 46.8 | |
| GEMEncoder=ViT-B/16, Model=CLIP, Pretraining=WIT-400M, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=false2023.12 | 46.2 | |
| CLIP SurgeryEncoder=ViT-B/16, Model=CLIP, Pretraining=WIT-400M, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=false, Evaluation_Source=Current Paper2023.12 | 41.2 | |
| ViL-SegEncoder=ViT-B/16, Model=scratch, Pretraining=GCC, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=true, Relaxed Constraints=true2023.12 | 34.4 | |
| MaskCLIPEncoder=ViT-B/16, Model=CLIP, Pretraining=WIT-400M, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=false, Evaluation_Source=Current Paper2023.12 | 28.6 | |
| ZS3NetEncoder=ResNet101, Model=scratch, Pretraining=VOC, Context, Annotation=SM, Localization Annotation=true, Localization Fine-tuning=true, Relaxed Constraints=true2023.12 | 17.7 | |
| SPNetEncoder=ResNet101, Model=scratch, Pretraining=COCO, VOC, Context, Annotation=SM, Localization Annotation=true, Localization Fine-tuning=true, Relaxed Constraints=true2023.12 | 15.6 | |
| CLIPEncoder=ViT-B/16, Model=CLIP, Pretraining=WIT-400M, Annotation=IT, Localization Annotation=false, Localization Fine-tuning=false2023.12 | 10.4 |