Image Classification on PatchCamelyon
91.5AccuracyCLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 91.5 | |
| CLIP+Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 91 | |
| MedDiffuseMixModel=EfficientNet-B42026.06 | 90.9 | |
| G-CSAModel Config=p4m-CSA2026.06 | 90.75 | |
| p4m-CSA2026.06 | 90.75 | |
| DINOv2Architecture=ViT-g/14, Pre-training Data=LVD, Resolution=518x518, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 90.7 | |
| AIM-7BArchitecture=ViT-7B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 90.7 | |
| AIM-7B†Architecture=ViT-7B/14, Pre-training Data=DFN-2B+, Feature Extraction Layer=20th, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 90.5 | |
| AIM-3BArchitecture=ViT-3B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 90.4 | |
| G-CSAModel Config=p4-CSA, Params=94.35K2026.06 | 90.38 | |
| p4-CSAParams=94.35K2026.06 | 90.38 | |
| MAEArchitecture=ViT-2B/14, Pre-training Data=IG-3B, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 90.3 | |
| DINOArchitecture=ViT-B/8, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 90.2 | |
| iBOTArchitecture=ViT-L/16, Pre-training Data=IN-21k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 90 | |
| AIM-0.6BArchitecture=ViT-H/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 90 | |
| AIM-1BArchitecture=ViT-1B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 90 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 90 | |
| MedDiffuseMixModel=Swin-T2026.06 | 90 | |
| G-CSAModel Config=p8-CSA2026.06 | 89.98 | |
| AIMv2architecture=ViT-3B/14, Resolution=448px2024.11 | 89.9 | |
| MAEArchitecture=ViT-H/14, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 89.8 | |
| MedDiffuseMixModel=DenseNet-1212026.06 | 89.8 | |
| αF-p4m-CNNParams=141.22K2026.06 | 89.12 | |
| DBAModel=EfficientNet-B42026.06 | 89 | |
| MedDiffuseMixModel=ResNet-502026.06 | 88.7 | |
| SaliencyMixModel=EfficientNet-B42026.06 | 88.7 | |
| αF-p4-CNNParams=140.45K2026.06 | 88.66 | |
| DBAModel=Swin-T2026.06 | 88.5 | |
| GenMixModel=EfficientNet-B42026.06 | 88.4 | |
| p4m-CNNParams=124.21K2026.06 | 88.36 | |
| MedDiffuseMixModel=ViT-B/162026.06 | 88.3 | |
| BEiTArchitecture=ViT-L/14, Pre-training Data=IN-21k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 88.2 | |
| DBAModel=DenseNet-1212026.06 | 88.2 | |
| SaliencyMixModel=Swin-T2026.06 | 88.2 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 88.1 | |
| MixupModel=EfficientNet-B42026.06 | 88 | |
| SaliencyMixModel=DenseNet-1212026.06 | 87.9 | |
| GenMixModel=Swin-T2026.06 | 87.9 | |
| GenMixModel=DenseNet-1212026.06 | 87.6 | |
| p4-CNNParams=129.65K2026.06 | 87.55 | |
| Standard AugModel=EfficientNet-B42026.06 | 87.5 | |
| MixupModel=Swin-T2026.06 | 87.5 | |
| UNICOMPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 87.4 | |
| DBAModel=ResNet-502026.06 | 87.2 | |
| MixupModel=DenseNet-1212026.06 | 87.2 | |
| Standard AugModel=Swin-T2026.06 | 87 | |
| SaliencyMixModel=ResNet-502026.06 | 86.9 | |
| DBAModel=ViT-B/162026.06 | 86.8 | |
| Standard AugModel=DenseNet-1212026.06 | 86.7 | |
| No AugModel=EfficientNet-B42026.06 | 86.7 | |
| GenMixModel=ResNet-502026.06 | 86.6 | |
| SaliencyMixModel=ViT-B/162026.06 | 86.5 | |
| G-CSAModel Config=Z2-CSA2026.06 | 86.4 | |
| Z2-CSA2026.06 | 86.4 | |
| GenMixModel=ViT-B/162026.06 | 86.2 | |
| No AugModel=Swin-T2026.06 | 86.2 | |
| MixupModel=ResNet-502026.06 | 86.1 | |
| No AugModel=DenseNet-1212026.06 | 85.9 | |
| MixupModel=ViT-B/162026.06 | 85.8 | |
| Standard AugModel=ResNet-502026.06 | 85.6 | |
| Standard AugModel=ViT-B/162026.06 | 85.2 | |
| No AugModel=ResNet-502026.06 | 84.8 | |
| G-SAModel Config=p4m-SA2026.06 | 84.76 | |
| EsViTBackbone=Swin-T, Evaluation Protocol=Linear probe2021.06 | 84.6 | |
| No AugModel=ViT-B/162026.06 | 84.4 | |
| Z2-CNNParams=130.60K2026.06 | 84.07 | |
| SupervisedBackbone=Swin-T, Evaluation Protocol=Linear probe2021.06 | 84 | |
| G-SAModel Config=p8-SA2026.06 | 83.58 | |
| G-SAModel Config=p4-SA, Params=205.66K2026.06 | 83.44 | |
| G-SAModel Config=Z2-SA2026.06 | 83.04 | |
| CLIPBackbone=ResNet-50, Evaluation Protocol=Linear probe2021.06 | 82.7 | |
| SupervisedBackbone=ResNet-50, Evaluation Protocol=Linear probe, Reproduced=true2021.06 | 82.6 | |
| SupervisedBackbone=ResNet-50, Evaluation Protocol=Linear probe2021.06 | 82.5 | |
| CLIPBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 59.8 | |
| CLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 54.3 | |
| SigLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 53.5 | |
| ITO sub2Backbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 52.8 | |
| FLAIRPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 51.8 | |
| ITO sub2Pre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 50.9 | |
| ITOBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 50.4 | |
| SLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 50 | |
| ITOPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 50 |