Image Classification on ImageNet 1K (val) (FT Accuracy)
86.2FT AccuracyMIRL
Evaluation Results
| Method | Links | |
|---|---|---|
| MIRLEncoder=ViT-B-48, #params=341M, FLOPs=67.0G, Training Data=IN1K, Epochs=800, Resolution=224x2242023.09 | 86.2 | |
| MAEEncoder=ViT-L, #params=307M, FLOPs=59.7G, Training Data=IN1K, Epochs=1600, Resolution=224x2242023.09 | 85.9 | |
| HPMEncoder=ViT-L, #params=307M, FLOPs=59.7G, Training Data=IN1K, Epochs=800, Resolution=224x2242023.09 | 85.8 | |
| MaskFeatEncoder=ViT-L, #params=307M, FLOPs=59.7G, Training Data=IN1K, Epochs=1600, Resolution=224x2242023.09 | 85.7 | |
| ConMIMEncoder=ViT-L, #params=307M, FLOPs=59.7G, Training Data=IN1K, Epochs=1600, Resolution=224x2242023.09 | 85.5 | |
| MAEEncoder=ViT-L, #params=307M, FLOPs=59.7G, Training Data=IN1K, Epochs=800, Resolution=224x2242023.09 | 85.4 | |
| MIRLEncoder=ViT-B-48, #params=341M, FLOPs=67.0G, Training Data=IN1K, Epochs=300, Resolution=224x2242023.09 | 85.3 | |
| MIRLEncoder=ViT-S-54, #params=96M, FLOPs=18.8G, Training Data=IN1K, Epochs=800, Resolution=224x2242023.09 | 84.8 | |
| MIRLEncoder=ViT-B-24, #params=171M, FLOPs=33.5G, Training Data=IN1K, Epochs=300, Resolution=224x2242023.09 | 84.7 | |
| MAEEncoder=ViT-L, #params=307M, FLOPs=59.7G, Training Data=IN1K, Epochs=300, Resolution=224x2242023.09 | 84.5 | |
| MIRLEncoder=ViT-S-54, #params=96M, FLOPs=18.8G, Training Data=IN1K, Epochs=300, Resolution=224x2242023.09 | 84.4 | |
| MIRLEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=IN1K, Epochs=800, Resolution=224x2242023.09 | 84.1 | |
| LocalMIMEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=IN1K, Epochs=1600, Resolution=224x2242023.09 | 84 | |
| SimMIMEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=IN1K, Epochs=800, Resolution=224x2242023.09 | 83.8 | |
| MAEEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=IN1K, Epochs=1600, Resolution=224x2242023.09 | 83.6 | |
| MIRLEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=IN1K, Epochs=300, Resolution=224x2242023.09 | 83.5 | |
| CIMEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=DALLE250M+IN1K, Epochs=300, Resolution=224x2242023.09 | 83.3 | |
| MoCov3Encoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=IN1K, Epochs=300, Resolution=224x2242023.09 | 83.2 | |
| BEITEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=DALLE250M+IN1K, Epochs=800, Resolution=224x2242023.09 | 83.2 | |
| MAEEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=IN1K, Epochs=800, Resolution=224x2242023.09 | 83.1 | |
| MAEEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=IN1K, Epochs=300, Resolution=224x2242023.09 | 82.6 | |
| SupervisedEncoder=ViT-L, #params=307M, FLOPs=59.7G, Training Data=IN1K, Epochs=N/A, Resolution=224x2242023.09 | 82.6 | |
| SupervisedEncoder=ViT-B, #params=86M, FLOPs=16.8G, Training Data=IN1K, Epochs=N/A, Resolution=224x2242023.09 | 82.3 |