Image Recognition on Infographic
58.8AccuracyDINOv2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DINOv2Architecture=ViT-g/14, Pre-training Data=LVD, Resolution=518x518, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 58.8 | — | |
| AIM-7B†Architecture=ViT-7B/14, Pre-training Data=DFN-2B+, Feature Extraction Layer=20th, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 57.7 | — | |
| MAEArchitecture=ViT-2B/14, Pre-training Data=IG-3B, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 50.2 | — | |
| AIM-7BArchitecture=ViT-7B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 49.6 | — | |
| AIM-3BArchitecture=ViT-3B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 48.9 | — | |
| iBOTArchitecture=ViT-L/16, Pre-training Data=IN-21k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 47.7 | — | |
| AIM-1BArchitecture=ViT-1B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 47.5 | — | |
| AIM-0.6BArchitecture=ViT-H/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 45.2 | — | |
| MAEArchitecture=ViT-H/14, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 42.2 | — | |
| DINOArchitecture=ViT-B/8, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 41.1 | — | |
| BEiTArchitecture=ViT-L/14, Pre-training Data=IN-21k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 25.9 | — | |
| AIMv2architecture=ViT-3B/14, Resolution=448px2024.11 | — | 74.8 |