Image Recognition on Describable Textures Dataset (DTD)
99.3AccuracyUNICOM
Evaluation Results
| Method | Links | |
|---|---|---|
| UNICOMPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 99.3 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 99.3 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 99.2 | |
| CLIP+Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 99.2 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 98.8 | |
| AIMv2architecture=ViT-3B/14, Resolution=448px2024.11 | 89 | |
| DINOv2Architecture=ViT-g/14, Pre-training Data=LVD, Resolution=518x518, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 86.3 | |
| AIM-7B†Architecture=ViT-7B/14, Pre-training Data=DFN-2B+, Feature Extraction Layer=20th, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 85.6 | |
| SARELearning Paradigm=Training-based2026.03 | 83.1 | |
| AIM-7BArchitecture=ViT-7B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 82.3 | |
| AIM-3BArchitecture=ViT-3B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 81.9 | |
| AIM-1BArchitecture=ViT-1B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 81.8 | |
| iBOTArchitecture=ViT-L/16, Pre-training Data=IN-21k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 81.6 | |
| MAEArchitecture=ViT-2B/14, Pre-training Data=IG-3B, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 81.2 | |
| AIM-0.6BArchitecture=ViT-H/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 80.1 | |
| DINOArchitecture=ViT-B/8, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 78.4 | |
| MAEArchitecture=ViT-H/14, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 78.1 | |
| VT-FSLLearning Paradigm=Training-based2026.03 | 76.31 | |
| UniFGVCLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 73.9 | |
| Qwen2.5-VL-7BLearning Paradigm=Backbone2026.03 | 68.83 | |
| BEiTArchitecture=ViT-L/14, Pre-training Data=IN-21k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 64 | |
| FineDeficsLearning Paradigm=Training-based2026.03 | 63.53 | |
| SCANLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 62.65 | |
| AutoSEPLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 61.47 | |
| ProtoMMLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 56.38 | |
| AWTLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 55.2 | |
| CascadeVLMLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 53.24 | |
| SuS-X-LCLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 52.34 | |
| E-FineRLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 50.27 | |
| FineRLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 49.76 | |
| RARLearning Paradigm=Training-free, Method Strategy=Retrieval-based2026.03 | 49.57 | |
| CLIP-B/32Learning Paradigm=Backbone2026.03 | 44.26 |