Image Classification on iNaturalist 2018
94.6Top-1 AccuracyOmniVec2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OmniVec22025.07 | 94.6 | — | — | |
| OmniVec2025.07 | 93.8 | — | — | |
| InternImage2025.07 | 92.6 | — | — | |
| InternImage-HBackbone=InternImage-H, Pre-training=427M joint dataset2022.11 | 92.6 | — | — | |
| MAWSPre-training Dataset=IG-3B, Architecture=ViT-6.5B, Resolution=5182023.03 | 91.7 | — | — | |
| MAWSPre-training Dataset=IG-3B, Architecture=ViT-2B, Resolution=5182023.03 | 91.3 | — | — | |
| MAWSPre-training Dataset=IG-3B, Architecture=ViT-H, Resolution=5182023.03 | 90.5 | — | — | |
| MetaFormerBackbone=MetaFormer2022.11 | 88.7 | — | — | |
| MetaFormer2025.07 | 87.5 | — | — | |
| Hiera-H448backbone=Hiera-H4482023.06 | 87.3 | — | — | |
| MAE2025.07 | 86.8 | — | — | |
| MAEBackbone=ViT-H, Input Resolution=448, Pre-train Data=IN1K, Evaluation Protocol=Fine-tuned2021.11 | 86.8 | — | — | |
| ViT-H448backbone=ViT-H4482023.06 | 86.8 | — | — | |
| MAEPre-training Dataset=IN1k, Architecture=ViT-H, Resolution=4482023.03 | 86.8 | — | — | |
| SWAGPre-training Dataset=IG-3.6B, Architecture=ViT-H, Resolution=5182023.03 | 86 | — | — | |
| AIMv2architecture=ViT-3B/14, Resolution=448px2024.11 | 85.9 | — | — | |
| Omnivore2025.07 | 84.1 | — | — | |
| Hiera-Hbackbone=Hiera-H2023.06 | 83.5 | — | — | |
| OmniMAEArch.=ViT-H, Pretrain Data=IN1K + SSv22022.06 | 83.2 | — | — | |
| MAEBackbone=ViT-H, Pre-train Data=IN1K, Evaluation Protocol=Fine-tuned2021.11 | 83 | — | — | |
| ViT-Hbackbone=ViT-H2023.06 | 83 | — | — | |
| MAEArch.=ViT-H, Pretrain Data=IN1K2022.06 | 83 | — | — | |
| DINOv2architecture=ViT-g/142024.11 | 83 | — | — | |
| DINOv2Arch=ViT-g/14, Protocol=Frozen linear probe2023.04 | 81.6 | — | — | |
| RDNet-LParam (M)=186, FLOPs (G)=34.7, Pre-training=ImageNet-1k2024.03 | 81.5 | — | — | |
| AIMv2architecture=ViT-3B/142024.11 | 81.5 | — | — | |
| mtLoRArank=162026.03 | 81.5 | — | 64 | |
| EfficientNetBackbone=B82025.07 | 81.3 | — | — | |
| GrafitBackbone=RegNetY-8.0GF, Pre-training=ImageNet-1k, Resolution=384x384, Number of Parameters=39M, Classifier=MLP2020.11 | 81.2 | — | — | |
| GrafitBackbone=RegNetY-8.0GF, Parameters=39M, Resolution=384x3842020.11 | 81.2 | — | — | |
| Previous best2021.11 | 81.2 | — | — | |
| Hiera-Lbackbone=Hiera-L2023.06 | 80.9 | — | — | |
| MixMAEBackbone=Swin-L, FLOPs (G)=35.8, Params. (M)=2352022.05 | 80.6 | — | — | |
| RDNet-BParam (M)=87, FLOPs (G)=15.4, Pre-training=ImageNet-1k2024.03 | 80.5 | — | — | |
| DINOv2Arch=ViT-L/14, Protocol=Frozen linear probe2023.04 | 80.4 | — | — | |
| LoRAHubrank=162026.03 | 80.2 | — | 61.5 | |
| DeiT-B⚗ ↑384im/sec=85.9, resolution=384, distillation=true2020.12 | 80.1 | — | — | |
| MAEBackbone=ViT-L, Pre-train Data=IN1K, Evaluation Protocol=Fine-tuned2021.11 | 80.1 | — | — | |
| MAEBackbone=ViT-L, FLOPs (G)=61.3, Params. (M)=3042022.05 | 80.1 | — | — | |
| ViT-Lbackbone=ViT-L2023.06 | 80.1 | — | — | |
| MAEArch.=ViT-L, Pretrain Data=IN1K2022.06 | 80.1 | — | — | |
| Hiera-B+backbone=Hiera-B+2023.06 | 79.9 | — | — | |
| AIMv2architecture=ViT-1B/142024.11 | 79.7 | — | — | |
| OmniMAEArch.=ViT-L, Pretrain Data=IN1K + SSv22022.06 | 79.6 | — | — | |
| DeiT-B ↑384im/sec=85.9, resolution=3842020.12 | 79.5 | — | — | |
| Deit-BFLOPs=52.8G, Resolution=384x384, Pre-training=ImageNet2021.03 | 79.5 | — | — | |
| CeiT-SFLOPs=12.9G, Resolution=384x384, Pre-training=ImageNet2021.03 | 79.4 | — | — | |
| RDNet-SParam (M)=50, FLOPs (G)=8.7, Pre-training=ImageNet-1k2024.03 | 79.1 | — | — | |
| HydraLoRArank=16, hyperparameter search=optimal, BLC optimization=true2026.03 | 78.5 | — | 61.7 | |
| MixMAEBackbone=Swin-B/W14, FLOPs (G)=16.3, Params. (M)=882022.05 | 78.2 | — | — | |
| Omni-MAE2025.07 | 78.1 | — | — | |
| CaiT-M-36 ↑ 224Resolution=224, Crop-ratio=0.875, Training=Longer schedules2021.03 | 78 | — | — | |
| MMoELoRArank=162026.03 | 78 | — | 61.2 | |
| Hiera-Bbackbone=Hiera-B2023.06 | 77.9 | — | — | |
| AIMv2architecture=ViT-H/142024.11 | 77.9 | — | — | |
| SigLIParchitecture=ViT-So400m/142024.11 | 77.4 | — | — | |
| CaiT-S-36 224Resolution=224, Crop-ratio=0.8752021.03 | 77.1 | — | — | |
| CaiT-S-36 ↑ 224Resolution=224, Crop-ratio=0.875, Training=Longer schedules2021.03 | 77 | — | — | |
| RDNet-TParam (M)=24, FLOPs (G)=5.0, Pre-training=ImageNet-1k2024.03 | 77 | — | — | |
| CaiT-M-36 224Resolution=224, Crop-ratio=0.8752021.03 | 76.9 | — | — | |
| Grafit RegNetY-8GFim/sec=591.62020.12 | 76.8 | — | — | |
| Grafit RegNetY-8GFFLOPs=8.0G, Pre-training=ImageNet2021.03 | 76.8 | — | — | |
| MugsBackbone=ViT-B/162022.03 | 76.4 | — | — | |
| DINOv2Arch=ViT-B/14, Protocol=Frozen linear probe2023.04 | 76.4 | — | — | |
| DFN-CLIParchitecture=ViT-H/142024.11 | 76.4 | — | — | |
| AIMv2architecture=ViT-L/142024.11 | 76 | — | — | |
| DeiT-III-LParam (M)=304, FLOPs (G)=61.6, Pre-training=ImageNet-1k2024.03 | 75.6 | — | — | |
| AIMv1architecture=ViT-7B/142024.11 | 75.5 | — | — | |
| DFN-CLIParchitecture=ViT-L/142024.11 | 75.5 | — | — | |
| MAEBackbone=ViT-B, Pre-train Data=IN1K, Evaluation Protocol=Fine-tuned2021.11 | 75.4 | — | — | |
| MAEBackbone=ViT-B/162022.03 | 75.4 | — | — | |
| MAEBackbone=ViT-B, FLOPs (G)=17.5, Params. (M)=862022.05 | 75.4 | — | — | |
| ViT-Bbackbone=ViT-B2023.06 | 75.4 | — | — | |
| MAEArch.=ViT-B, Pretrain Data=IN1K2022.06 | 75.4 | — | — | |
| SigLIParchitecture=ViT-L/162024.11 | 75.1 | — | — | |
| Ours (DINOv2)Data=INet-22k, Arch.=L/142024.06 | 75.1 | — | — | |
| iBOTBackbone=ViT-B/162022.03 | 74.6 | — | — | |
| GML lossEpochs=400, Backbone=ResNet-502023.05 | 74.5 | — | — | |
| MugsBackbone=ViT-S/162022.03 | 74.4 | — | — | |
| OmniMAEArch.=ViT-B, Pretrain Data=IN1K + K4002022.06 | 74.2 | — | — | |
| DisAlignBackbone=ResNet-152, Training Epochs=200 E, Classifier Type=Linear2021.03 | 74.1 | — | — | |
| OmniMAEArch.=ViT-B, Pretrain Data=IN1K + SSv22022.06 | 74 | — | — | |
| DeiT-B⚗im/sec=290.9, resolution=224, distillation=true2020.12 | 73.7 | — | — | |
| iBOTBackbone=ViT-S/162022.03 | 73.7 | — | — | |
| DeiT-III-BParam (M)=87, FLOPs (G)=17.5, Pre-training=ImageNet-1k2024.03 | 73.6 | — | — | |
| ProCoBackbone=ResNet-50, Epochs=902024.03 | 73.5 | — | — | |
| OAI CLIParchitecture=ViT-L/142024.11 | 73.5 | — | — | |
| CeiT-SFLOPs=4.5G, Resolution=224x224, Pre-training=ImageNet2021.03 | 73.3 | — | — | |
| DeiT-Bim/sec=292.3, resolution=2242020.12 | 73.2 | — | — | |
| DeiT-B 224Resolution=224, Crop-ratio=0.8752021.03 | 73.2 | — | — | |
| Deit-BFLOPs=17.3G, Resolution=224x224, Pre-training=ImageNet2021.03 | 73.2 | — | — | |
| SupervisedBackbone=ViT-B/16, Pre-training=Supervised, Evaluation Protocol=finetuning2021.04 | 73.2 | — | — | |
| Deit-B/16FLOPs=17.5B, Resolution=224, Pre-training Dataset=ImageNet-1k, Evaluation Protocol=Fine-tune2021.05 | 73.2 | — | — | |
| Sup.Backbone=ViT-B/162022.03 | 73.2 | — | — | |
| PaCoEpochs=400, Backbone=ResNet-502023.05 | 73.2 | — | — | |
| DeiT-BParam (M)=87, FLOPs (G)=17.5, Pre-training=ImageNet-1k2024.03 | 73.2 | — | — | |
| GML lossEpochs=100, Backbone=ResNet-502023.05 | 73.1 | — | — | |
| OpenCLIPArch=ViT-G/14, Protocol=Frozen linear probe2023.04 | 73 | — | — | |
| DisAlignBackbone=ResNet-152, Training Epochs=200 E, Classifier Type=Cosine2021.03 | 72.8 | — | — | |
| DINOBackbone=ViT-B/16, Pre-training=Self-supervised, Evaluation Protocol=finetuning2021.04 | 72.6 | — | — |