Image Classification on ImageNet 1K (val) (Top-1, Top-3, Top-5 Accuracy)
84.4AccuracyQUEST
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| QUESTEvaluation Protocol=Finetuning2026.03 | 84.4 | — | — | — | |
| StandardEvaluation Protocol=Finetuning2026.03 | 84.1 | — | — | — | |
| QUESTEvaluation Protocol=Linear2026.03 | 80.5 | — | — | — | |
| StandardEvaluation Protocol=Linear2026.03 | 80.3 | — | — | — | |
| MVTArch=ViT-g2025.12 | 79.1 | — | — | — | |
| MVT + FTArch=ViT-g2025.12 | 79 | — | — | — | |
| QUESTEvaluation Protocol=kNN2026.03 | 79 | — | — | — | |
| Vanilla FTArch=ViT-g2025.12 | 78.9 | — | — | — | |
| EVAArch=ViT-g2025.12 | 78.8 | — | — | — | |
| StandardEvaluation Protocol=kNN2026.03 | 78.7 | — | — | — | |
| FRONTBackbone=ResNet-1522026.03 | 77.2 | — | — | — | |
| MVT + FTArch=ViT-L2025.12 | 76.9 | — | — | — | |
| Random InitializationBackbone=ResNet-1522026.03 | 76.8 | — | — | — | |
| Vanilla FTArch=ViT-L2025.12 | 76.1 | — | — | — | |
| FRONTBackbone=ResNet-502026.03 | 76.1 | — | — | — | |
| CLIPArch=ViT-L2025.12 | 75.8 | — | — | — | |
| MVTArch=ViT-L2025.12 | 75.2 | — | — | — | |
| Random InitializationBackbone=ResNet-502026.03 | 74.1 | — | — | — | |
| QUESTEvaluation Protocol=Few-shot, Few-shot percentage=1% imgs2026.03 | 72.7 | — | — | — | |
| StandardEvaluation Protocol=Few-shot, Few-shot percentage=1% imgs2026.03 | 72.3 | — | — | — | |
| QUESTEvaluation Protocol=Few-shot, Few-shot shots=5 imgs/cls2026.03 | 69 | — | — | — | |
| StandardEvaluation Protocol=Few-shot, Few-shot shots=5 imgs/cls2026.03 | 68.3 | — | — | — | |
| VQAArch=ViT-L2025.12 | 64.9 | — | — | — | |
| VQAArch=ViT-g2025.12 | 64.3 | — | — | — | |
| CLIPArch=ViT-B2025.12 | 62.9 | — | — | — | |
| CLIPArch=RN1012025.12 | 61.7 | — | — | — | |
| QUESTEvaluation Protocol=Few-shot, Few-shot shots=2 imgs/cls2026.03 | 61.7 | — | — | — | |
| StandardEvaluation Protocol=Few-shot, Few-shot shots=2 imgs/cls2026.03 | 61.1 | — | — | — | |
| CLIPArch=RN502025.12 | 59.7 | — | — | — | |
| QUESTEvaluation Protocol=Few-shot, Few-shot shots=1 img/cls2026.03 | 52.5 | — | — | — | |
| StandardEvaluation Protocol=Few-shot, Few-shot shots=1 img/cls2026.03 | 51.6 | — | — | — | |
| EgoViTWT-allBackbone=ViT-S, Pre-training Dataset=WT-all, Evaluation Protocol=k-NN2026.03 | 45.3 | — | — | — | |
| EgoViTWT-Sub5Backbone=ViT-S, Pre-training Dataset=WT-Sub5, Evaluation Protocol=k-NN2026.03 | 42.7 | — | — | — | |
| CA2DIPC=50, Label Regime=HL2026.04 | 41.56 | — | — | — | |
| EgoViTVeniceBackbone=ViT-S, Pre-training Dataset=Venice video, Evaluation Protocol=k-NN2026.03 | 39.2 | — | — | — | |
| EgoViTWT-allBackbone=ViT-S, Pre-training Dataset=WT-all, Evaluation Protocol=Linear Probing2026.03 | 39.1 | — | — | — | |
| EgoViTBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=k-NN2026.03 | 38.9 | — | — | — | |
| RDEDIPC=50, Label Regime=HL2026.04 | 38.49 | — | — | — | |
| EgoViTWT-Sub5Backbone=ViT-S, Pre-training Dataset=WT-Sub5, Evaluation Protocol=Linear Probing2026.03 | 37.2 | — | — | — | |
| AttMaskBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=k-NN2026.03 | 35.9 | — | — | — | |
| EgoViTVeniceBackbone=ViT-S, Pre-training Dataset=Venice video, Evaluation Protocol=Linear Probing2026.03 | 35.8 | — | — | — | |
| DINOBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=k-NN2026.03 | 35.5 | — | — | — | |
| DORAVeniceBackbone=ViT-S, Pre-training Dataset=Venice video, Evaluation Protocol=k-NN2026.03 | 34.8 | — | — | — | |
| EgoViTBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=Linear Probing2026.03 | 34 | — | — | — | |
| DORABackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=k-NN2026.03 | 33.7 | — | — | — | |
| iBOTBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=k-NN2026.03 | 33.6 | — | — | — | |
| SimCLRBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=k-NN2026.03 | 33.1 | — | — | — | |
| MoCo-v3Backbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=k-NN2026.03 | 31.2 | — | — | — | |
| SAVi++Backbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=k-NN2026.03 | 31.2 | — | — | — | |
| DINOBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=Linear Probing2026.03 | 30.9 | — | — | — | |
| PooDLeVeniceBackbone=ResNet-50, Pre-training Dataset=Venice video, Evaluation Protocol=k-NN2026.03 | 30.8 | — | — | — | |
| DORAVeniceBackbone=ViT-S, Pre-training Dataset=Venice video, Evaluation Protocol=Linear Probing2026.03 | 30.2 | — | — | — | |
| DORABackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=Linear Probing2026.03 | 29.6 | — | — | — | |
| SAVi++Backbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=Linear Probing2026.03 | 29.3 | — | — | — | |
| PooDLeVeniceBackbone=ResNet-50, Pre-training Dataset=Venice video, Evaluation Protocol=Linear Probing2026.03 | 28.9 | — | — | — | |
| SimCLRBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=Linear Probing2026.03 | 28.2 | — | — | — | |
| iBOTBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=Linear Probing2026.03 | 27.5 | — | — | — | |
| AttMaskBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=Linear Probing2026.03 | 25.4 | — | — | — | |
| MoCo-v3Backbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=Linear Probing2026.03 | 22.5 | — | — | — | |
| D4MIPC=50, Label Regime=HL2026.04 | 21.56 | — | — | — | |
| FAD-RMIPC=50, Label Regime=HL2026.04 | 21.21 | — | — | — | |
| MAEBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=k-NN2026.03 | 17.8 | — | — | — | |
| MAEBackbone=ViT-S, Pre-training Dataset=Zurich video, Evaluation Protocol=Linear Probing2026.03 | 13 | — | — | — | |
| SRe2LIPC=50, Label Regime=HL2026.04 | 9.79 | — | — | — | |
| CLIPEvaluation Mode=Zero-shot, Prompt engineering=true, Image Encoder=ResNet-50, Text Encoder=Transformer, Pre-training Data=CC3M2022.05 | — | 20.03 | 33.04 | 39.35 | |
| CLIPZero-shot=true, Pre-training dataset=CC3M2023.03 | — | 16.72 | 28.61 | 34.38 | |
| CyCLIPEvaluation Mode=Zero-shot, Prompt engineering=true, Image Encoder=ResNet-50, Text Encoder=Transformer, Pre-training Data=CC3M, lambda_1=0.25, lambda_2=0.252022.05 | — | 22.08 | 35.98 | 42.3 | |
| CyCLIPZero-shot=true, Pre-training dataset=CC3M2023.03 | — | 17.77 | 30.06 | 36.2 | |
| OURS_BrZero-shot=true, Pre-training dataset=CC3M, regularizer=Brownian bridge2023.03 | — | 20.45 | 33.56 | 39.28 | |
| OURS_GCZero-shot=true, Pre-training dataset=CC3M, regularizer=geometry consistency2023.03 | — | 20.25 | 33.5 | 39.91 | |
| OURS_SepZero-shot=true, Pre-training dataset=CC3M, regularizer=feature-separation2023.03 | — | 20.21 | 33.25 | 39.6 |