Image Classification on NABirds
89.2AccuracyFixRes
Evaluation Results
| Method | Links | |
|---|---|---|
| FixResBackbone=SENet-1542019.06 | 89.2 | |
| SENet-154Evaluation Protocol=Baseline2019.06 | 88.3 | |
| PAIRS2018.01 | 87.9 | |
| CMNBackbone=ResNet-502020.12 | 87.8 | |
| Cross-XBackbone=ResNet-502020.12 | 86.2 | |
| SSFBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.39, Data Augmentation=Basic2023.10 | 85.9 | |
| SSF*Backbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.39, Data Augmentation=Advanced (cutmix, mixup, label smoothing)2023.10 | 85.7 | |
| ARC*Backbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.25, Data Augmentation=Advanced (cutmix, mixup, label smoothing)2023.10 | 85.7 | |
| LoRABackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.442023.10 | 85.6 | |
| ARCBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.252023.10 | 85.3 | |
| ARCattBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.222023.10 | 85 | |
| HACEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Label Smoothing Condition=No label smooth.2026.05 | 84.96 | |
| HACEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Label Smoothing Condition=Soft label, Beta=302026.05 | 84.96 | |
| HACEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Label Smoothing Condition=Label smooth.2026.05 | 84.78 | |
| HACEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Label Smoothing Condition=Soft label, Beta=102026.05 | 84.7 | |
| AdapterBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.412023.10 | 84.3 | |
| BiasBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.282023.10 | 84.2 | |
| VPT-DeepBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.852023.10 | 84.2 | |
| FT-ResNetBackbone=ResNet-50, re-implementation=true2020.12 | 84 | |
| SCEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Label Smoothing Condition=No label smooth.2026.05 | 83.5 | |
| SCEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Label Smoothing Condition=Soft label, Beta=302026.05 | 83.5 | |
| SCEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Label Smoothing Condition=Label smooth.2026.05 | 83.02 | |
| MaxEntBackbone=DenseNet-1612020.12 | 83 | |
| SCEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Label Smoothing Condition=Soft label, Beta=102026.05 | 83 | |
| PC-DenseNet-1612019.06 | 82.8 | |
| Full fine-tuningBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=85.982023.10 | 82.7 | |
| SupervisedStage 2 pre-training=false, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 80.09 | |
| BYOL+CVSAStage 2 pre-training=true, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 79.64 | |
| Bilinear CNNReference=PAMI 20172018.01 | 79.4 | |
| BilinearCNNBackbone=VGG-162020.12 | 79.4 | |
| ResNet-50 BaselineBackbone=ResNet-502018.01 | 79.2 | |
| HXEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Alpha=0.22026.05 | 79.09 | |
| BYOL+DiLoStage 2 pre-training=true, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 79.04 | |
| BYOLStage 2 pre-training=false, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 78.89 | |
| InsLocStage 2 pre-training=true, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 78.86 | |
| VPT-ShallowBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.252023.10 | 78.8 | |
| SimCLRStage 2 pre-training=false, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 76.3 | |
| BYOLStage 2 pre-training=true, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 76.12 | |
| Linear probingBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Params(M)=0.182023.10 | 75.9 | |
| MoCo.v2Stage 2 pre-training=false, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 75.64 | |
| MoCo.v2Stage 2 pre-training=true, Evaluation protocol=fine-tuned evaluation, Stage 1 pre-training dataset=ImageNet-1k, Backbone=ResNet-50, Pre-training epochs=8002021.06 | 73.96 | |
| SCEArchitecture=ResNet-34, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 71.01 | |
| HACEArchitecture=ResNet-34, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 69.44 | |
| MaxEntBackbone=ResNet-502020.12 | 69.2 | |
| HACEArchitecture=ResNet-18, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 67.93 | |
| HACEArchitecture=ResNet-50, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 67.9 | |
| R12Student Model=LCNet-35, Teacher Selection Metric=R122026.05 | 67.8 | |
| HXEEvaluation Protocol=Linear probing, Backbone=DINOv2-Large, Alpha=0.52026.05 | 64.86 | |
| SCEArchitecture=ResNet-18, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 62.94 | |
| TACStudent Model=LCNet-35, Teacher Selection Metric=TAC2026.05 | 62.4 | |
| SSPStudent Model=LCNet-35, Teacher Selection Metric=SSP2026.05 | 62.4 | |
| SCEArchitecture=ResNet-50, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 59.07 | |
| HACEArchitecture=ConvNeXt-T, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 50.74 | |
| HACEArchitecture=Swin-T, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 44.01 | |
| SCEArchitecture=Swin-T, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 41.51 | |
| SCEArchitecture=ConvNeXt-T, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 30.35 | |
| HACEArchitecture=ViT-B/16, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 29.16 | |
| SCEArchitecture=ViT-B/16, Evaluation Protocol=End-to-end training, Aggregation Strategy=Best across all dilution values d in {0.2, 0.5, 0.7} and LR pairings2026.05 | 27.44 | |
| CEStudent Model=LCNet-35, Teacher Selection Metric=None (Cross-Entropy)2026.05 | 22.9 | |
| PLeaSBackbone=ViT, Model Style=CLIP, Initialization=Same2024.07 | 8.3 | |
| MuDSCBackbone=ViT, Model Style=CLIP, Initialization=Same2024.07 | 8 | |
| Simple AvgBackbone=ViT, Model Style=CLIP, Initialization=Same2024.07 | 7.8 | |
| RegMeanBackbone=ViT, Model Style=CLIP, Initialization=Same2024.07 | 7.7 |