Image Recognition on ImageNet-1K
91Top-1 AccuracyAbsolute SOTA
Evaluation Results
| Method | Links | |
|---|---|---|
| Absolute SOTA2024.06 | 91 | |
| MiCoBackbone=ViT-g2024.06 | 89.8 | |
| VT-FSLLearning Paradigm=Training-based2026.03 | 89.75 | |
| AIMv2architecture=ViT-3B/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=448px, Pre-training samples=12B2024.11 | 89.5 | |
| AIMv2architecture=ViT-3B/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px, Pre-training samples=12B2024.11 | 88.5 | |
| Meta-TransformerBackbone=ViT-L2024.06 | 88.1 | |
| AIMv2architecture=ViT-1B/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px, Pre-training samples=12B2024.11 | 88.1 | |
| AIMv2architecture=ViT-H/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px, Pre-training samples=12B2024.11 | 87.5 | |
| SigLIParchitecture=ViT-So400m/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px2024.11 | 87.3 | |
| DINOv2architecture=ViT-g/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px2024.11 | 87.2 | |
| Ours w/ PointBindSetting=Fine-tuning2024.03 | 86.94 | |
| DFN-CLIParchitecture=ViT-H/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px2024.11 | 86.9 | |
| AIMv2architecture=ViT-L/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px, Pre-training samples=12B2024.11 | 86.6 | |
| DFN-CLIParchitecture=ViT-L/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px2024.11 | 86.5 | |
| SigLIParchitecture=ViT-L/16, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px2024.11 | 86.5 | |
| OAI CLIParchitecture=ViT-L/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px2024.11 | 85.7 | |
| SARELearning Paradigm=Training-based2026.03 | 85.06 | |
| AIMv1architecture=ViT-7B/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px2024.11 | 84 | |
| Ours w/ PointBindSetting=Zero-shot2024.03 | 83.25 | |
| Meta-TransformerSetting=Fine-tuning2024.03 | 83.1 | |
| MAEarchitecture=ViT-2B/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px2024.11 | 82.2 | |
| UniFGVCLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 81.1 | |
| ImageBindBackbone=ViT-H2024.06 | 80.2 | |
| ImageBindSetting=Fine-tuning, Protocol=linear2024.03 | 80.19 | |
| PointBindSetting=Fine-tuning, Protocol=linear2024.03 | 80.19 | |
| PointBind (+Event)Setting=Fine-tuning2024.03 | 80.19 | |
| AIMv1architecture=ViT-H/14, Evaluation protocol=Attentive probing, Backbone status=Frozen, Resolution=224px2024.11 | 78.5 | |
| ImageBindSetting=Zero-shot2024.03 | 77.7 | |
| PointBindSetting=Zero-shot2024.03 | 77.7 | |
| PointBind (+Event)Setting=Zero-shot2024.03 | 77.7 | |
| CascadeVLMLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 73.98 | |
| ProtoMMLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 72.76 | |
| SCANLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 72.14 | |
| AutoSEPLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 71.45 | |
| FineDeficsLearning Paradigm=Training-based2026.03 | 71.41 | |
| AWTLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 71.32 | |
| RARLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 70.26 | |
| E-FineRLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 69.02 | |
| FineRLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 68.65 | |
| Qwen2.5-VL-7BLearning Paradigm=Backbone2026.03 | 68.4 | |
| SuS-X-LCLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 66.87 | |
| CLIP-B/32Learning Paradigm=Backbone2026.03 | 63.67 |