Fine-grained Image Classification on CUB200 2011 (test)
93.1AccuracyHERBS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| HERBS2023.03 | 93.1 | — | — | |
| PIMBackbone=Swin-T2022.02 | 92.8 | — | — | |
| MDCMBackbone=MS-ViT-Base2025.04 | 92.5 | — | — | |
| MetaFormer2023.03 | 92.4 | — | — | |
| M2FormerBackbone=MS-ViT-Base2025.04 | 92.4 | — | — | |
| MetaFormer-1Backbone=MetaFormer-1, Pretrain=iNat212022.03 | 92.3 | — | — | |
| HERBSBackbone=Swin-Base2025.04 | 92.3 | — | — | |
| Baseline + DCALBackbone=R50-ViT-Base2022.05 | 92 | — | — | |
| Relational ProxyBackbone=ResNet-50, Local views (k)=8, Averaged over runs=52022.10 | 92 | — | — | |
| DCAL2023.03 | 92 | — | — | |
| DCALBackbone=ViT-Base2025.04 | 92 | — | — | |
| MpT-TransBackbone=ViT-Base2025.04 | 92 | — | — | |
| SR-GNNBackbone=Xception, Attentional Refinement=true2022.09 | 91.9 | — | — | |
| CAP2023.03 | 91.9 | — | — | |
| SR-GNN2023.03 | 91.9 | — | — | |
| CAPBackbone=Xception2022.02 | 91.8 | — | — | |
| CAPBackbone=Xception, Pretrain=ImageNet-1k2022.03 | 91.8 | — | — | |
| MetaFormer-0Backbone=MetaFormer-0, Pretrain=iNat212022.03 | 91.8 | — | — | |
| ViTintegrated_with_SAC=true2022.05 | 91.8 | — | — | |
| CAPBackbone=Xception2022.09 | 91.8 | — | — | |
| CAP2022.10 | 91.8 | — | — | |
| IELT2023.03 | 91.8 | — | — | |
| SIM-Trans2023.03 | 91.8 | — | — | |
| SAC2023.03 | 91.8 | — | — | |
| SIM-TransBackbone=ViT-Base2025.04 | 91.8 | — | — | |
| IELTBackbone=ViT-Base2025.04 | 91.8 | — | — | |
| ACC-ViTBackbone=ViT-Base2025.04 | 91.8 | — | — | |
| MP-FGVCBackbone=ViT-Base2025.04 | 91.8 | — | — | |
| TransFGBackbone=ViT-B_162022.02 | 91.7 | — | — | |
| TransFGBackbone=ViT-B-16, Pretrain=ImageNet-21k2022.03 | 91.7 | — | — | |
| TransFGBackbone=ViT-Base2022.05 | 91.7 | — | — | |
| TrnFGBackbone=ViT-B-16, Text Description=true2022.09 | 91.7 | — | — | |
| TransFG2022.10 | 91.7 | — | — | |
| ViT-NeT2023.03 | 91.7 | — | — | |
| TransFG2023.03 | 91.7 | — | — | |
| TransFGBackbone=ViT-Base2025.04 | 91.7 | — | — | |
| FFVT2022.10 | 91.65 | — | — | |
| FFVTBackbone=ViT-B_162022.02 | 91.6 | — | — | |
| FFVT2023.03 | 91.6 | — | — | |
| AF-TransBackbone=ViT-Base2025.04 | 91.6 | — | — | |
| AFTransBackbone=ViT-B_162022.02 | 91.5 | — | — | |
| Baseline + DCALBackbone=ViT-Base2022.05 | 91.4 | — | — | |
| RAMS-TransBackbone=ViT-B_162022.02 | 91.3 | — | — | |
| TPSKGBackbone=ViT-B_162022.02 | 91.3 | — | — | |
| MetaFormer-1Backbone=MetaFormer-1, Pretrain=ImageNet-21k2022.03 | 91.3 | — | — | |
| RAMS-TransBackbone=ViT-Base2022.05 | 91.3 | — | — | |
| BaselineBackbone=R50-ViT-Base2022.05 | 91.3 | — | — | |
| TPSKGBackbone=ViT-B-16, Resolution=448 x 4482021.07 | 91.3 | — | — | |
| RAMS-TransBackbone=ViT-Base2025.04 | 91.3 | — | — | |
| CAMFBackbone=Swin Transformer, Vision Transformer=true2022.09 | 91.2 | — | — | |
| Gradient-based FVEpart detector=CS-Parts [24], optimization=gradient descent2020.07 | 91.2 | — | — | |
| CCFRBackbone=ResNet-502022.02 | 91.1 | — | — | |
| WS_DANintegrated_with_SAC=true2022.05 | 91.1 | — | — | |
| EM-based FVEpart detector=CS-Parts [24], optimization=online EM algorithm2020.07 | 91.1 | — | — | |
| DeepFVEBackbone=InceptionV32022.02 | 91 | — | — | |
| ViTintegrated_with_SAC=false2022.05 | 91 | — | — | |
| TransIFC+Backbone=Swin-Base2025.04 | 91 | — | — | |
| GAPpart detector=CS-Parts [24], aggregation=concatenated part features and GAP2020.07 | 90.9 | — | — | |
| BaselineBackbone=ViT-Base2022.05 | 90.8 | — | — | |
| MMALintegrated_with_SAC=true2022.05 | 90.8 | — | — | |
| Baseline + CALBackbone=ResNet-1012021.08 | 90.6 | — | — | |
| CALBackbone=ResNet-1012022.02 | 90.6 | — | — | |
| CALBackbone=ResNet101, Pretrain=ImagNet-1k2022.03 | 90.6 | — | — | |
| CALBackbone=ResNet1012022.05 | 90.6 | — | — | |
| CALintegrated_with_SAC=false2022.05 | 90.6 | — | — | |
| ViTBackbone=ViT-Base2025.04 | 90.6 | — | — | |
| TA-CFNBackbone=ResNet502025.04 | 90.5 | — | — | |
| Stacked LSTM2020.05 | 90.4 | — | — | |
| Ge et al.feature type=Part-based features, maximum # of parts=10, ground-truth part annotation=None2019.09 | 90.4 | — | — | |
| Stacked LSTM2021.08 | 90.4 | — | — | |
| StackedLSTMBackbone=GoogleNet2022.02 | 90.4 | — | — | |
| CPMBackbone=GoogleNet, Pretrain=ImageNet-1k2022.03 | 90.4 | — | — | |
| Parts Modelsintegrated_with_SAC=false2022.05 | 90.4 | — | — | |
| CPMBackbone=GoogLeNet, Resolution=over 8002021.07 | 90.4 | — | — | |
| ViTBackbone=ViT-B-16, Resolution=448 x 4482021.07 | 90.4 | — | — | |
| CPMBackbone=GoogLeNet, Joint Learning=true2022.09 | 90.4 | — | — | |
| Stacked LSTM2020.07 | 90.3 | — | — | |
| Mix+Backbone=ResNet-502022.02 | 90.2 | — | — | |
| SR-GNNBackbone=Xception, Attentional Refinement=false2022.09 | 90.2 | — | — | |
| DTintegrated_with_SAC=true2022.05 | 90.1 | — | — | |
| PARTType=Joint, Backbone=ResNet101, Additional Annotations=false2022.12 | 90.1 | — | — | |
| API-NetBackbone=DenseNet-161, Extra Supervision=No2020.02 | 90 | — | — | |
| API-Net2020.05 | 90 | — | — | |
| API-Net2020.11 | 90 | — | — | |
| API-NetBackbone=DenseNet-1612021.08 | 90 | — | — | |
| API-NetBackbone=DenseNet-1612022.02 | 90 | — | — | |
| API-NetBackbone=DenseNet-161, Pretrain=ImageNet-1k2022.03 | 90 | — | — | |
| API-NetBackbone=DenseNet1612022.05 | 90 | — | — | |
| API-Netintegrated_with_SAC=false2022.05 | 90 | — | — | |
| API-NETBackbone=DenseNet-161, Resolution=512 x 5122021.07 | 90 | — | — | |
| APINBackbone=DenseNet-1612022.09 | 90 | — | — | |
| API-Net2020.07 | 90 | — | — | |
| Ours_PMGInput Resolution=448x448, Backbone=PMG2020.11 | 89.9 | — | — | |
| WSintegrated_with_SAC=true2022.05 | 89.9 | — | — | |
| PMGBackbone=ResNet-502022.09 | 89.9 | — | — | |
| GDSMP-NetBackbone=ResNet502025.04 | 89.9 | — | — | |
| Spatial RNN2020.05 | 89.7 | — | — | |
| MetaFormer-1Backbone=MetaFormer-1, Pretrain=ImageNet-1k2022.03 | 89.7 | — | — | |
| CTF-CapsNetBackbone=ResNet-50, Resolution=448 x 4482021.07 | 89.7 | — | — | |
| TBMSL-Netapproach=multi-scale and multi-patch2020.05 | 89.6 | — | — |