Fine-grained visual classification on NABirds (test)
93Top-1 AccuracyHERBS
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| HERBS2023.03 | 93 | — | — | — | — | |
| PIMBackbone=Swin-T2022.02 | 92.8 | — | — | — | — | |
| MetaFormer-1Backbone=MetaFormer-1, Pretrain=iNat212022.03 | 92.7 | — | — | — | — | |
| MetaFormer2023.03 | 92.7 | — | — | — | — | |
| CSQA-NetBackbone=Swin-B2024.03 | 92.3 | — | — | — | — | |
| FET-FGVCBackbone=Swin-B2024.03 | 91.7 | — | — | — | — | |
| MetaFormer-1Backbone=MetaFormer-1, Pretrain=ImageNet-21k2022.03 | 91.6 | — | — | — | — | |
| ACC-ViTBackbone=ViT-B-162024.03 | 91.4 | — | — | — | — | |
| Dual-TRBackbone=ViT-B-162024.03 | 91.3 | — | — | — | — | |
| MetaFormer-0Backbone=MetaFormer-0, Pretrain=iNat212022.03 | 91.2 | — | — | — | — | |
| SR-GNN2022.09 | 91.2 | — | — | — | — | |
| SR-GNNBackbone=Xception, Attentional Refinement=true2022.09 | 91.2 | — | — | — | — | |
| Relational ProxyBackbone=ResNet-50, Local views (k)=8, Averaged over runs=52022.10 | 91.2 | — | — | — | — | |
| SR-GNN2023.03 | 91.2 | — | — | — | — | |
| Proposed (CAP)Transfer/Joint Learning Strategy=false2021.01 | 91 | — | — | — | — | |
| CAPBackbone=Xception2022.02 | 91 | — | — | — | — | |
| CAPBackbone=Xception, Pretrain=ImageNet-1k2022.03 | 91 | — | — | — | — | |
| SotA2022.09 | 91 | — | — | — | — | |
| CAPBackbone=Xception2022.09 | 91 | — | — | — | — | |
| CAP2022.10 | 91 | — | — | — | — | |
| CAP2023.03 | 91 | — | — | — | — | |
| MP-FGVCBackbone=ViT-B-162023.09 | 91 | — | — | — | — | |
| TransIFC+Backbone=Swin-B2024.03 | 90.9 | — | — | — | — | |
| TransFGBackbone=ViT-B_162021.03 | 90.8 | — | — | — | — | |
| TransFGBackbone=ViT2022.02 | 90.8 | — | — | — | — | |
| TransFGBackbone=ViT-B-16, Pretrain=ImageNet-21k2022.03 | 90.8 | — | — | — | — | |
| TrnFGBackbone=ViT-B-16, Text Description=true2022.09 | 90.8 | — | — | — | — | |
| TransFG2022.10 | 90.8 | — | — | — | — | |
| TransFG2023.03 | 90.8 | — | — | — | — | |
| IELT2023.03 | 90.8 | — | — | — | — | |
| TransFGBackbone=ViT-B-162024.03 | 90.8 | — | — | — | — | |
| IELTBackbone=ViT-B-162024.03 | 90.8 | — | — | — | — | |
| TransFGBackbone=ViT-B-16, reproduced=true2023.09 | 90.5 | — | — | — | — | |
| Gradient-based FVEpart detector=CS-Parts [24], optimization=gradient descent2020.07 | 90.4 | — | — | — | — | |
| EM-based FVEpart detector=CS-Parts [24], optimization=online EM algorithm2020.07 | 90.3 | — | — | — | — | |
| SIM-TransBackbone=ViT-B-16, reproduced=true2023.09 | 90.3 | — | — | — | — | |
| IELTBackbone=ViT-B-16, reproduced=true2023.09 | 90.1 | — | — | — | — | |
| CSQA-NetBackbone=ResNet-502024.03 | 90 | — | — | — | — | |
| ViTBackbone=ViT-B_162021.03 | 89.9 | — | — | — | — | |
| ViTBackbone=ViT-B-16, Vision Transformer=true2022.09 | 89.9 | — | — | — | — | |
| SR-GNNBackbone=Xception, Attentional Refinement=false2022.09 | 89.9 | — | — | — | — | |
| GAPpart detector=CS-Parts [24], aggregation=concatenated part features and GAP2020.07 | 89.9 | — | — | — | — | |
| LGTFBackbone=ResNet-502024.03 | 89.5 | — | — | — | — | |
| FFVT2022.10 | 89.42 | — | — | — | — | |
| MetaFormer-1Backbone=MetaFormer-1, Pretrain=ImageNet-1k2022.03 | 89.4 | — | — | — | — | |
| FixSENet-154Backbone=SENet-1542021.03 | 89.2 | — | — | — | — | |
| FixSENet-154Backbone=SENet-1542022.02 | 89.2 | — | — | — | — | |
| FixSENetBackbone=SENet-154, Pretrain=ImageNet-1k2022.03 | 89.2 | — | — | — | — | |
| FixSENet-1542020.07 | 89.2 | — | — | — | — | |
| GDSMP-NetBackbone=ResNet-502024.03 | 89 | — | — | — | — | |
| SR-GNNBackbone=ResNet-502024.03 | 88.8 | — | — | — | — | |
| MGE-CNNBackbone=ResNet-1012022.02 | 88.6 | — | — | — | — | |
| MGEBackbone=ResNet-1012022.09 | 88.6 | — | — | — | — | |
| MGE-CNN2020.07 | 88.6 | — | — | — | — | |
| MGE-CNNBackbone=CNN2023.09 | 88.6 | — | — | — | — | |
| Our parts (classification-specific part estimation)feature type=Part-based features, maximum # of parts=4, ground-truth part annotation=None2019.09 | 88.5 | — | — | — | — | |
| CS-PartsBackbone=ResNet-502021.03 | 88.5 | — | — | — | — | |
| CS-PartBackbone=ResNet-502022.02 | 88.5 | — | — | — | — | |
| CSPEBackbone=Inception-V32022.09 | 88.5 | — | — | — | — | |
| CS-Parts2020.07 | 88.5 | — | — | — | — | |
| PRISBackbone=CNN2023.09 | 88.4 | — | — | — | — | |
| API-NetBackbone=DenseNet-161, Extra Supervision=No2020.02 | 88.1 | — | — | — | — | |
| API-NetBackbone=DenseNet-1612021.03 | 88.1 | — | — | — | — | |
| API-NetBackbone=DenseNet-1612022.02 | 88.1 | — | — | — | — | |
| API-NetBackbone=DenseNet-161, Pretrain=ImageNet-1k2022.03 | 88.1 | — | — | — | — | |
| APINBackbone=DenseNet-1612022.09 | 88.1 | — | — | — | — | |
| API-Net2020.07 | 88.1 | — | — | — | — | |
| API-NetBackbone=CNN2023.09 | 88.1 | — | — | — | — | |
| API-NetBackbone=DenseNet1612024.03 | 88.1 | — | — | — | — | |
| GaRDBackbone=ResNet-502022.09 | 88 | — | — | — | — | |
| GHRDBackbone=CNN2023.09 | 88 | — | — | — | — | |
| GHORDBackbone=ResNet-502024.03 | 88 | — | — | — | — | |
| Cui et al.feature type=Global features, ground-truth part annotation=None2019.09 | 87.9 | — | — | — | — | |
| DSTLTransfer/Joint Learning Strategy=true2021.01 | 87.9 | — | — | — | — | |
| PAIRSBackbone=ResNet-502022.02 | 87.9 | — | — | — | — | |
| DSTLBackbone=Inception-v3, Pretrain=iNat172022.03 | 87.9 | — | — | — | — | |
| DSTLBackbone=Inception-V3, Joint Learning=true2022.09 | 87.9 | — | — | — | — | |
| Cui et al.2020.07 | 87.9 | — | — | — | — | |
| PAIRS2020.07 | 87.9 | — | — | — | — | |
| DSTLBackbone=CNN2023.09 | 87.9 | — | — | — | — | |
| DSTLBackbone=Inception-v32024.03 | 87.9 | — | — | — | — | |
| SPABackbone=Parametric2022.09 | 87.6 | — | — | — | — | |
| Linear SVMfeature type=Global features, ground-truth part annotation=None2019.09 | 87.5 | — | — | — | — | |
| MMAL2022.10 | 87.1 | — | — | — | — | |
| No Parts (baseline)parts=none, features=global image only2020.07 | 86.9 | — | — | — | — | |
| API-NetBackbone=ResNet-101, Extra Supervision=No2020.02 | 86.6 | — | — | — | — | |
| Cross-XTransfer/Joint Learning Strategy=false2021.01 | 86.4 | — | — | — | — | |
| Cross-XBackbone=ResNet-502021.03 | 86.4 | — | — | — | — | |
| Cross-XBackbone=ResNet-502022.02 | 86.4 | — | — | — | — | |
| Cross-XBackbone=Squeeze-and-Excitation2022.09 | 86.4 | — | — | — | — | |
| Cross-XBackbone=CNN2023.09 | 86.4 | — | — | — | — | |
| Cross-XBackbone=ResNet-502024.03 | 86.4 | — | — | — | — | |
| API-NetBackbone=ResNet-50, Extra Supervision=No2020.02 | 86.2 | — | — | — | — | |
| Cross-XBackbone=ResNet50, Pretrain=ImageNet-1k2022.03 | 86.2 | — | — | — | — | |
| SSFBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.39, AugReg=true2024.03 | 85.7 | — | — | — | — | |
| ARC*Backbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.25, AugReg=true2024.03 | 85.7 | — | — | — | — | |
| LoRABackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.44, AugReg=false2024.03 | 85.6 | — | — | — | — | |
| ARCBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.25, AugReg=false2024.03 | 85.3 | — | — | — | — | |
| RLRR*Backbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.47, AugReg=true2024.03 | 85.3 | — | — | — | — | |
| RLRRBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.47, AugReg=false2024.03 | 84.7 | — | — | — | — |