Image Classification on ImageNet (Accuracy and Performance)
86.4AccuracyViT-LMAE
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ViT-LMAERes/Patch=448/14, Backbone=ViT-L, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 86.4 | 190 | 645 | 31.4 | — | |
| APTRes/Patch=448/14, Backbone=ViT-L, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 86.3 | 302 | 268 | 16.9 | 86 | |
| ViT-LMAERes/Patch=336/14, Backbone=ViT-L, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 86.1 | 395 | 174.7 | 15.9 | — | |
| APTRes/Patch=336/14, Backbone=ViT-L, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 86.1 | 527 | 76.8 | 9.9 | 61 | |
| ResizingRes/Patch=448/14, Backbone=ViT-L, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 86 | 302 | 267 | 16.9 | 86 | |
| ResizingRes/Patch=336/14, Backbone=ViT-L, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 85.9 | 527 | 76.2 | 9.9 | 61 | |
| RandomRes/Patch=448/14, Backbone=ViT-L, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 85.8 | 314 | 267 | 16.2 | 94 | |
| RandomRes/Patch=336/14, Backbone=ViT-L, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 85.5 | 550 | 76.2 | 9.6 | 66 | |
| ViT-BMAERes/Patch=384/16, Backbone=ViT-B, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 84.2 | 1,151 | 49.4 | 11.6 | — | |
| APTRes/Patch=384/16, Backbone=ViT-B, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 84.2 | 1,390 | 21.9 | 9 | 29 | |
| ResizingRes/Patch=384/16, Backbone=ViT-B, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 83.9 | 1,390 | 21.5 | 9 | 29 | |
| RandomRes/Patch=384/16, Backbone=ViT-B, Pre-training=MAE, Fine-Tuning Protocol=Full Fine-Tuning2025.10 | 83.4 | 1,401 | 21.5 | 8.8 | 32 |