Image Classification on ImageNet-1K (val) (Top-1 Accuracy, Throughput, and FLOPs)
82.9Top-1 AccuracyBaseline
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BaselineBackbone=DeiT-B, Resolution=384, fine-tuning=false2025.12 | 82.9 | 89 | — | |
| BaselineBackbone=DeiT-B, Resolution=224, fine-tuning=false2025.12 | 81.8 | 283 | — | |
| EViTBackbone=DeiT-B, Resolution=224, fine-tuning=false2025.12 | 80.5 | 440 | — | |
| NAPBackbone=DeiT-B, Resolution=224, fine-tuning=false2025.12 | 80.5 | 434 | — | |
| BaselineBackbone=DeiT-S, Resolution=224, fine-tuning=false2025.12 | 79.8 | 915 | — | |
| Evo-ViTBackbone=DeiT-B, Resolution=224, fine-tuning=false2025.12 | 79.1 | 415 | — | |
| NAPBackbone=DeiT-B, Resolution=384, fine-tuning=false2025.12 | 78.5 | 173 | — | |
| EViTBackbone=DeiT-B, Resolution=384, fine-tuning=false2025.12 | 77.4 | 175 | — | |
| DyViTBackbone=DeiT-B, Resolution=224, fine-tuning=false2025.12 | 75.5 | 420 | — | |
| NAPBackbone=DeiT-S, Resolution=224, fine-tuning=false2025.12 | 74 | 1,600 | — | |
| EViTBackbone=DeiT-S, Resolution=224, fine-tuning=false2025.12 | 73.8 | 1,660 | — | |
| Evo-ViTBackbone=DeiT-S, Resolution=224, fine-tuning=false2025.12 | 72.1 | 1,403 | — | |
| DyViTBackbone=DeiT-S, Resolution=224, fine-tuning=false2025.12 | 51.7 | 1,585 | — |