KNN classification on ImageNet-1k (val)
84.1Top-1 AccuracyEUPE-ViT-B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EUPE-ViT-BBackbone=ViT-B, Evaluation Protocol=k-NN2026.03 | 84.1 | — | |
| SigLIP2-BBackbone=ViT-B, Evaluation Protocol=k-NN2026.03 | 83.2 | — | |
| DINOv3-ViT-BBackbone=ViT-B, Evaluation Protocol=k-NN, Text Encoder Usage=no txt2026.03 | 83 | — | |
| RADIOv2.5-BBackbone=ViT-B, Evaluation Protocol=k-NN2026.03 | 81.9 | — | |
| PEcore-BBackbone=ViT-B, Evaluation Protocol=k-NN2026.03 | 79.7 | — | |
| SupervisedEpochs=902021.01 | 74.8 | — | |
| JFT-ViTBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=7682022.05 | 72.1 | 87.2 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=7682022.05 | 71.85 | 86.92 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=3842022.05 | 71.73 | 87.08 | |
| JFT-ViTBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=3842022.05 | 71.67 | 86.98 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=1922022.05 | 71.34 | 86.62 | |
| JFT-ViTBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=1922022.05 | 71.32 | 86.21 | |
| MRL-EBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=7682022.05 | 71.31 | 86.62 | |
| MRL-EBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=3842022.05 | 71.18 | 86.46 | |
| MRL-EBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=1922022.05 | 70.41 | 86.01 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=962022.05 | 69.74 | 85.86 | |
| Grafit FCBackbone=ResNet-50, Number of parameters=~23.5M2020.11 | 69.1 | — | |
| GrafitBackbone=ResNet-50, Number of parameters=32.9M2020.11 | 69.1 | — | |
| MRL-EBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=962022.05 | 68.8 | 85.13 | |
| JFT-ViTBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=962022.05 | 68.56 | 85.13 | |
| ALIGNBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=7682022.05 | 68 | 86.1 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=7682022.05 | 67.85 | 85.85 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=3842022.05 | 67.7 | 85.73 | |
| ALIGNBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=3842022.05 | 67.65 | 85.7 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=482022.05 | 67.24 | 84.37 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=1922022.05 | 67 | 85.36 | |
| MRL-EBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=482022.05 | 66.89 | 83.8 | |
| ALIGNBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=1922022.05 | 66.71 | 85.27 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=962022.05 | 65.72 | 84.61 | |
| BYOL-EMANEpochs=2002021.01 | 64.9 | — | |
| JFT-ViTBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=482022.05 | 63.58 | 81.8 | |
| MoCo-EMANEpochs=8002021.01 | 62.8 | — | |
| BYOLEpochs=2002021.01 | 62.8 | — | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=242022.05 | 62.8 | 81.51 | |
| MRL-EBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=242022.05 | 62.4 | 81.36 | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=482022.05 | 62.33 | 82.3 | |
| ALIGNBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=962022.05 | 61.82 | 81.97 | |
| MoCoEpochs=8002021.01 | 60 | — | |
| ClusterFit+Backbone=ResNet-50, Number of parameters=32.9M2020.11 | 59.5 | — | |
| SwAVEpochs=8002021.01 | 59.2 | — | |
| MoCo-EMANEpochs=2002021.01 | 58 | — | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=242022.05 | 56.44 | 78.19 | |
| SNCA+Backbone=ResNet-50, Number of parameters=32.9M2020.11 | 55.4 | — | |
| Baseline (ours)Backbone=ResNet-50, Number of parameters=~23.5M2020.11 | 54.7 | — | |
| MoCoEpochs=2002021.01 | 54.5 | — | |
| PCLEpochs=2002021.01 | 54.5 | — | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=122022.05 | 53.61 | 75.3 | |
| SNCA, Wu et al.Backbone=ResNet-50, Number of parameters=~23.5M2020.11 | 52.8 | — | |
| MRL-EBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=122022.05 | 51.54 | 73.94 | |
| ALIGNBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=482022.05 | 51.32 | 73.15 | |
| LA2021.01 | 49.4 | — | |
| JFT-ViTBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=242022.05 | 48.64 | 70.2 | |
| Baseline, Wu et al.Backbone=ResNet-50, Number of parameters=~23.5M2020.11 | 48.1 | — | |
| InstDisc2021.01 | 46.5 | — | |
| MRLBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=122022.05 | 43.57 | 67.36 | |
| DUNE-BBackbone=ViT-B, Evaluation Protocol=k-NN, Text Encoder Usage=no txt2026.03 | 42.5 | — | |
| ALIGNBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=242022.05 | 33.35 | 55.58 | |
| JFT-ViTBackbone=ViT-B/16, Pre-training Dataset=JFT, Rep. Size=122022.05 | 27.07 | 48.57 | |
| ALIGNBackbone=ViT-B/16, Pre-training Dataset=ALIGN, Rep. Size=122022.05 | 11.9 | 28.05 |