Image Recognition on iWildCam
85.1AccuracyALIA + Provenance-Based Input Gradient Guidance
Evaluation Results
| Method | Links | |
|---|---|---|
| ALIA + Provenance-Based Input Gradient GuidanceAggregation=Max2026.04 | 85.1 | |
| ALIA + Provenance-Based Input Gradient GuidanceAggregation=Mean2026.04 | 84.4 | |
| ALIA2026.04 | 83.5 | |
| CutMix2026.04 | 77.2 | |
| Baseline2026.04 | 75 | |
| Random Augment2026.04 | 71.3 | |
| DINOv2Architecture=ViT-g/14, Pre-training Data=LVD, Resolution=518x518, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 68.2 | |
| iBOTArchitecture=ViT-L/16, Pre-training Data=IN-21k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 61.8 | |
| AIM-7B†Architecture=ViT-7B/14, Pre-training Data=DFN-2B+, Feature Extraction Layer=20th, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 61.4 | |
| AIM-7BArchitecture=ViT-7B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 59.5 | |
| AIM-3BArchitecture=ViT-3B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 58.8 | |
| AIM-1BArchitecture=ViT-1B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 58.6 | |
| DINOArchitecture=ViT-B/8, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 58.5 | |
| MAEArchitecture=ViT-H/14, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 58.1 | |
| AIM-0.6BArchitecture=ViT-H/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 57.9 | |
| MAEArchitecture=ViT-2B/14, Pre-training Data=IG-3B, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 57.8 | |
| BEiTArchitecture=ViT-L/14, Pre-training Data=IN-21k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 52 | |
| HCD + GroupDROINIT.=HCD, METHOD=GroupDRO, Backbone=ResNet-502026.03 | 33.09 | |
| HCD + IRMINIT.=HCD, METHOD=IRM, Backbone=ResNet-502026.03 | 32.94 | |
| HCD + VRex*INIT.=HCD, METHOD=VRex*, Backbone=ResNet-502026.03 | 31.57 | |
| HCD + IRMXINIT.=HCD, METHOD=IRMX, Backbone=ResNet-502026.03 | 31.1 | |
| ERM + IRMXINIT.=ERM, METHOD=IRMX, Backbone=ResNet-502026.03 | 28.82 | |
| ERM + VRexINIT.=ERM, METHOD=VRex, Backbone=ResNet-502026.03 | 28.82 | |
| ERM + IRMINIT.=ERM, METHOD=IRM, Backbone=ResNet-502026.03 | 28.76 | |
| ERM + GroupDROINIT.=ERM, METHOD=GroupDRO, Backbone=ResNet-502026.03 | 28.51 | |
| Bonsai + IRMXINIT.=Bonsai, METHOD=IRMX, Backbone=ResNet-502026.03 | 27.62 | |
| Bonsai + IRMINIT.=Bonsai, METHOD=IRM, Backbone=ResNet-502026.03 | 27.6 | |
| Bonsai + GroupDROINIT.=Bonsai, METHOD=GroupDRO, Backbone=ResNet-502026.03 | 27.16 | |
| Bonsai + VRexINIT.=Bonsai, METHOD=VRex, Backbone=ResNet-502026.03 | 25.81 | |
| MVTMLLM=MMICL, Backbone=ViT-L2025.12 | 25 | |
| MVTMLLM=MMICL, Backbone=CLIP ViT-L2025.12 | 25 | |
| MVTArch=ViT-B/32, Supervisor=MMICL [280]2025.12 | 19.3 | |
| MVTMLLM=Otter, Backbone=ViT-L2025.12 | 16.2 | |
| MVTMLLM=Otter, Backbone=CLIP ViT-L2025.12 | 16.2 | |
| MVTArch=ResNet-50, Supervisor=MMICL [280]2025.12 | 14.5 | |
| CLIPMLLM=None, Backbone=ViT-L2025.12 | 13.4 | |
| CLIPMLLM=None, Backbone=CLIP ViT-L2025.12 | 13.4 | |
| CLIPArch=ViT-B/322025.12 | 10.9 | |
| CLIPArch=ResNet-502025.12 | 8.2 |