Semantic Segmentation on COCO Object (val)
0.676mIoULeopart
Evaluation Results
| Method | Links | |
|---|---|---|
| LeopartTraining Data=ImageNet + COCO, Evaluation Protocol=Linear Classification (LC)2022.04 | 0.676 | |
| CrOCBackbone=ViT-S/16, Pre-training Dataset=ImageNet2023.03 | 0.661 | |
| Sup. ViTTraining Data=ImageNet + ImageNet21k, Evaluation Protocol=Linear Classification (LC)2022.04 | 0.652 | |
| CrOCBackbone=ViT-S/16, Pre-training Dataset=COCO+2023.03 | 0.627 | |
| LeopartTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 0.625 | |
| DenseCLBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 0.604 | |
| CP2Backbone=ViT-S/16, Pre-training Dataset=ImageNet + PVOC122023.03 | 0.594 | |
| VICRegLBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 0.587 | |
| Sup. ResNetTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 0.578 | |
| ReSimBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 0.577 | |
| SoCoBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 0.568 | |
| SwAVTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 0.567 | |
| LeopartTraining Data=ImageNet + COCO, Evaluation Protocol=Overclustering (K=500)2022.04 | 0.559 | |
| ORLBackbone=ResNet50, Pre-training Dataset=COCO+2023.03 | 0.556 | |
| CrOCBackbone=ViT-S/16, Pre-training Dataset=COCO2023.03 | 0.556 | |
| PixProBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 0.547 | |
| DenseCLTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 0.53 | |
| Sup. ViTTraining Data=ImageNet + ImageNet21k, Evaluation Protocol=Overclustering (K=500)2022.04 | 0.509 | |
| DINOTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 0.506 | |
| BYOLBackbone=ResNet50, Pre-training Dataset=COCO+2023.03 | 0.504 | |
| LeopartTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 0.492 | |
| FlowDISzero-shot=true2026.05 | 0.477 | |
| MoCo-v2Training Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 0.475 | |
| MaskContrastTraining Data=ImageNet + Pascal VOC, Evaluation Protocol=Linear Classification (LC)2022.04 | 0.475 | |
| DINOBackbone=ViT-S/16, Pre-training Dataset=COCO2023.03 | 0.471 | |
| Sup. ResNetTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 0.442 | |
| CLIPtraseSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.436 | |
| DenseCLTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 0.41 | |
| DiffSegmenterTraining datasets=✘, Approach type=Diffusion models based2025.06 | 0.379 | |
| CASSSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.378 | |
| SwAVTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 0.373 | |
| MaskContrastTraining Data=ImageNet + Pascal VOC, Evaluation Protocol=Overclustering (K=500)2022.04 | 0.37 | |
| MoCo-v2Training Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 0.362 | |
| PnP-OVSSSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.362 | |
| ProxyCLIPSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.362 | |
| FA-SegTraining datasets=✘, Approach type=Diffusion models based2025.06 | 0.362 | |
| DiffCutTraining datasets=✘, Approach type=Diffusion models based2025.06 | 0.36 | |
| InvSegTraining datasets=✘, Approach type=Diffusion models based2025.06 | 0.36 | |
| MAEBackbone=ViT-S/16, Pre-training Dataset=COCO2023.03 | 0.351 | |
| CLIP-DINOiserSupporting Dataset=ImageNet1k, Extra-Training=true, Fair=false2024.11 | 0.348 | |
| Diffusion BaselineTraining datasets=✘, Approach type=Diffusion models based2025.06 | 0.345 | |
| LaVGSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.342 | |
| DiffCutLanguage Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 0.341 | |
| IRNet+CONTABackbone=ResNet-502020.09 | 0.334 | |
| NACLIPSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.332 | |
| ClearCLIPSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.33 | |
| ClearCLIPTraining datasets=✘, Approach type=Contrastive learning based2025.06 | 0.33 | |
| SEAM+CONTABackbone=ResNet-382020.09 | 0.328 | |
| IRNetBackbone=ResNet-50, re-implemented=true2020.09 | 0.326 | |
| CoDePublication=CVPR 2024, Training Dataset=CC3M+CC12M, Evaluation Protocol=Zero-shot2024.04 | 0.323 | |
| CoDeSupporting Dataset=CC3M+RedCaps, Extra-Training=true, Fair=false2024.11 | 0.323 | |
| SEAMBackbone=ResNet-38, re-implemented=true2020.09 | 0.319 | |
| RF-CLIPzero-shot=true2026.05 | 0.318 | |
| TCLPublication=CVPR 2023, Training Dataset=CC3M+CC12M, Evaluation Protocol=Zero-shot2024.04 | 0.316 | |
| TCLSupporting Dataset=CC3M+CC12M, Extra-Training=true, Fair=false2024.11 | 0.316 | |
| SAM-CLIPTraining datasets=Merged-41M, Approach type=Contrastive learning based2025.06 | 0.315 | |
| CLIP-DIYTraining datasets=✘, Approach type=Contrastive learning based2025.06 | 0.31 | |
| FreeSeg-DiffTraining datasets=✘, Approach type=Diffusion models based2025.06 | 0.31 | |
| SCLIPSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.305 | |
| SCLIPTraining datasets=✘, Approach type=Contrastive learning based2025.06 | 0.305 | |
| TCLTraining datasets=CC3M+CC12M, Approach type=Contrastive learning based2025.06 | 0.304 | |
| MaskCutk=5, Language Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 0.301 | |
| SimSegPublication=CVPR 2023, Training Dataset=CC3M+CC12M, Evaluation Protocol=Zero-shot2024.04 | 0.297 | |
| SimSegTraining datasets=CC3M+CC12M, Approach type=Contrastive learning based2025.06 | 0.297 | |
| PGSegPublication=NeurIPS 2023, Training Dataset=CC12M+RedCaps12M, Evaluation Protocol=Zero-shot2024.04 | 0.287 | |
| SCLIPzero-shot=true2026.05 | 0.283 | |
| GroupViTSupporting Dataset=CC12M+RedCaps, Extra-Training=true, Fair=false2024.11 | 0.275 | |
| GroupViTTraining datasets=CC12M, Approach type=Contrastive learning based2025.06 | 0.275 | |
| SegCLIPPublication=ICML 2023, Training Dataset=CC3M + COCO, Evaluation Protocol=Zero-shot2024.04 | 0.265 | |
| SegCLIPTraining datasets=CC3M+COCO, Approach type=Contrastive learning based2025.06 | 0.265 | |
| CLIPpyBackbone=ViT-B, Pretrain dataset=HQITP-134M, Supervision=text, Zero-shot transfer=true2023.01 | 0.255 | |
| OVSegmentorBackbone=ViT-B, Pretrain dataset=CC4M, Supervision=self+text, Zero-shot transfer=true2023.01 | 0.251 | |
| OVSegmentorPublication=CVPR 2023, Training Dataset=CC12M, Evaluation Protocol=Zero-shot2024.04 | 0.251 | |
| OVSegmentorTraining datasets=CC4M, Approach type=Contrastive learning based2025.06 | 0.251 | |
| GroupViTPublication=CVPR 2022, Training Dataset=CC3M+CC12M+YFCC14M, Evaluation Protocol=Zero-shot2024.04 | 0.243 | |
| CLIPpyBackbone=ViT-B, Pretrain dataset=CC12M, Supervision=text, Zero-shot transfer=true2023.01 | 0.238 | |
| SEC+CONTABackbone=VGG-162020.09 | 0.237 | |
| DINOTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 0.235 | |
| ViewCoPublication=ICLR 2023, Training Dataset=CC12M+YFCC14M, Evaluation Protocol=Zero-shot2024.04 | 0.235 | |
| ViewCoTraining datasets=CC12M+YFCC, Approach type=Contrastive learning based2025.06 | 0.235 | |
| DiffSeg†Language Dependency (LD)=false, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 0.232 | |
| CoCuPublication=NeurIPS 2023, Training Dataset=CC3M+CC12M+YFCC14M, Evaluation Protocol=Zero-shot2024.04 | 0.227 | |
| SECBackbone=VGG-162020.09 | 0.224 | |
| FreeCPzero-shot=true2026.05 | 0.216 | |
| GroupViTBackbone=ViT-S, Pretrain dataset=CC12M+YFCC15M, Supervision=text, Zero-shot transfer=true2023.01 | 0.209 | |
| MaskCLIPLanguage Dependency (LD)=true, Auxiliary Image (AX)=false, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 0.206 | |
| MaskCLIPSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.206 | |
| BFBPBackbone=VGG-162020.09 | 0.204 | |
| ZeroSegTraining datasets=IN-1K, Approach type=Contrastive learning based2025.06 | 0.202 | |
| Semantic DiffSegTraining datasets=✘, Approach type=Diffusion models based2025.06 | 0.191 | |
| OVSegmentorBackbone=ViT-S, Pretrain dataset=CC4M, Supervision=self+text, Zero-shot transfer=true2023.01 | 0.19 | |
| ViL-SegPublication=ECCV 2022, Training Dataset=CC3M+CC12M, Evaluation Protocol=Zero-shot2024.04 | 0.181 | |
| GroupViT*Backbone=ViT-S, Pretrain dataset=CC12M, Supervision=text, Zero-shot transfer=true2023.01 | 0.177 | |
| ReCoLanguage Dependency (LD)=true, Auxiliary Image (AX)=true, Unsupervised Adaptation (UA)=false, Training Type=Training-free2024.06 | 0.157 | |
| ReCoSupporting Dataset=ImageNet1k, Extra-Training=false, Fair=false2024.11 | 0.157 | |
| ReCoTraining datasets=✘, Approach type=Contrastive learning based2025.06 | 0.157 | |
| MaskCLIPTraining datasets=✘, Approach type=Contrastive learning based2025.06 | 0.155 | |
| CaRSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 0.154 | |
| GroupViT*Backbone=ViT-B, Pretrain dataset=CC4M, Supervision=text, Zero-shot transfer=true2023.01 | 0.107 | |
| GroupViT*Backbone=ViT-S, Pretrain dataset=CC4M, Supervision=text, Zero-shot transfer=true2023.01 | 0.091 |