Fine-grained Image Classification on CUB-200 (test)
91.9AccuracySR-GNN
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SR-GNN2022.09 | 91.9 | — | |
| SotA2022.09 | 91.8 | — | |
| MixUpalpha=1.0, Backbone=ViT-Base2025.10 | 88.75 | — | |
| FMixalpha=0.2, Backbone=ViT-Base2025.10 | 88.68 | — | |
| DeiTalpha=0.2, Backbone=ViT-Base2025.10 | 88.47 | — | |
| MergeMixalpha=1.0, Backbone=ViT-Base2025.10 | 88.4 | — | |
| SMMixalpha=1.0, Backbone=ViT-Base2025.10 | 88.35 | — | |
| GuidedMixapalpha=1.0, Backbone=ViT-Base2025.10 | 88.26 | — | |
| PuzzleMixalpha=1.0, Backbone=ViT-Base2025.10 | 88.23 | — | |
| TransMixalpha=1.0, Backbone=ViT-Base2025.10 | 88.1 | — | |
| Vanillaalpha=-, Backbone=ViT-Base2025.10 | 88 | — | |
| SaliencyMixalpha=0.2, Backbone=ViT-Base2025.10 | 87.92 | — | |
| CutMixalpha=0.2, Backbone=ViT-Base2025.10 | 87.76 | — | |
| ResizeMixalpha=1.0, Backbone=ViT-Base2025.10 | 87.61 | — | |
| Attentive-CutMixalpha=2.0, Backbone=ViT-Base2025.10 | 87.47 | — | |
| GridMixalpha=0.2, Backbone=ViT-Base2025.10 | 87.23 | — | |
| SmoothMixalpha=0.2, Backbone=ViT-Base2025.10 | 87.02 | — | |
| MixProalpha=1.0, Backbone=ViT-Base2025.10 | 86.93 | — | |
| MergeMixalpha=1.0, Backbone=DeiT-Small2025.10 | 85.4 | — | |
| GuidedMixapalpha=1.0, Backbone=DeiT-Small2025.10 | 84.71 | — | |
| PuzzleMixalpha=1.0, Backbone=DeiT-Small2025.10 | 84.39 | — | |
| MixUpalpha=1.0, Backbone=DeiT-Small2025.10 | 84.31 | — | |
| DeiTalpha=0.2, Backbone=DeiT-Small2025.10 | 84.04 | — | |
| SmoothMixalpha=0.2, Backbone=DeiT-Small2025.10 | 83.87 | — | |
| TransMixalpha=1.0, Backbone=DeiT-Small2025.10 | 83.34 | — | |
| SMMixalpha=1.0, Backbone=DeiT-Small2025.10 | 82.88 | — | |
| Attentive-CutMixalpha=2.0, Backbone=DeiT-Small2025.10 | 82.83 | — | |
| FMixalpha=0.2, Backbone=DeiT-Small2025.10 | 82.64 | — | |
| GridMixalpha=0.2, Backbone=DeiT-Small2025.10 | 82.34 | — | |
| SaliencyMixalpha=0.2, Backbone=DeiT-Small2025.10 | 82.34 | — | |
| MixProalpha=1.0, Backbone=DeiT-Small2025.10 | 82.31 | — | |
| ResizeMixalpha=1.0, Backbone=DeiT-Small2025.10 | 82.15 | — | |
| Vanillaalpha=-, Backbone=DeiT-Small2025.10 | 82.05 | — | |
| CutMixalpha=0.2, Backbone=DeiT-Small2025.10 | 81.69 | — | |
| Fine-tunedCategory=Baseline, Backbone=ViT-B/322026.06 | 78.1 | — | |
| BYOL+CVSAFirst-stage pre-training=COCO, Second-stage pre-training=true, Protocol=fine-tuned evaluation2021.06 | 69.14 | — | |
| LooC*First-stage pre-training=COCO, Second-stage pre-training=true, Protocol=fine-tuned evaluation2021.06 | 68.71 | — | |
| BYOL+DiLoFirst-stage pre-training=COCO, Second-stage pre-training=true, Protocol=fine-tuned evaluation2021.06 | 68.7 | — | |
| BYOLFirst-stage pre-training=COCO, Second-stage pre-training=false, Protocol=fine-tuned evaluation2021.06 | 68.55 | — | |
| MoCo.v2First-stage pre-training=COCO, Second-stage pre-training=false, Protocol=fine-tuned evaluation2021.06 | 68.47 | — | |
| SimCLRFirst-stage pre-training=COCO, Second-stage pre-training=false, Protocol=fine-tuned evaluation2021.06 | 68.3 | — | |
| BYOLFirst-stage pre-training=COCO, Second-stage pre-training=true, Protocol=fine-tuned evaluation2021.06 | 68.01 | — | |
| InsLocFirst-stage pre-training=COCO, Second-stage pre-training=true, Protocol=fine-tuned evaluation2021.06 | 67.94 | — | |
| Rot-PredFirst-stage pre-training=COCO, Second-stage pre-training=true, Protocol=fine-tuned evaluation2021.06 | 67.75 | — | |
| MoCo.v2First-stage pre-training=COCO, Second-stage pre-training=true, Protocol=fine-tuned evaluation2021.06 | 67.6 | — | |
| Rel-LocFirst-stage pre-training=COCO, Second-stage pre-training=true, Protocol=fine-tuned evaluation2021.06 | 67.33 | — | |
| TM-TA + SiMCategory=Dynamic model merging, Backbone=ViT-B/322026.06 | 67.1 | — | |
| TM-TIES + SiMCategory=Dynamic model merging, Backbone=ViT-B/322026.06 | 66.4 | — | |
| TSV-MCategory=Static model merging, Backbone=ViT-B/322026.06 | 65.7 | — | |
| EMR + SiMCategory=Dynamic model merging, Backbone=ViT-B/322026.06 | 65.5 | — | |
| TSV-C + SiMCategory=Dynamic model merging, Backbone=ViT-B/322026.06 | 65.5 | — | |
| TWIN-MergingCategory=Dynamic model merging, Backbone=ViT-B/322026.06 | 64.6 | — | |
| Task ArithmeticCategory=Static model merging, Backbone=ViT-B/322026.06 | 62.1 | — | |
| Iso-CCategory=Static model merging, Backbone=ViT-B/322026.06 | 61.8 | — | |
| TIES-MergingCategory=Static model merging, Backbone=ViT-B/322026.06 | 61.4 | — | |
| DaWinCategory=Dynamic model merging, Backbone=ViT-B/322026.06 | 61 | — | |
| MoW-MergingCategory=Dynamic model merging, Backbone=ViT-B/322026.06 | 58.9 | — | |
| WEMoECategory=Dynamic model merging, Backbone=ViT-B/322026.06 | 57 | — | |
| AdaLNAdaptation Method=Adaptive Layer Norm, Backbone=ViT-L/16, % Trainable parameters=0.1%, Backbone backpropagation=false2023.03 | — | 15.6 | |
| AdaLNBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=false2023.03 | — | 9.1 | |
| BitFitAdaptation Method=BitFit, Backbone=ViT-L/16, % Trainable parameters=0.1%, Backbone backpropagation=false2023.03 | — | 15.4 | |
| BitFitBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=false2023.03 | — | 8.8 | |
| Full FTAdaptation Method=Full fine-tuning, Backbone=ViT-L/16, % Trainable parameters=100%, Backbone backpropagation=false2023.03 | — | 9.1 | |
| Full FTBackbone=SWIN-L, % Trainable parameters=100%, No backbone backpropagation=false2023.03 | — | 9 | |
| In. LPAdaptation Method=Intermediate Linear Probing, Backbone=ViT-L/16, % Trainable parameters=0.1%, Backbone backpropagation=true2023.03 | — | 16.2 | |
| In. LPBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=true2023.03 | — | 10.2 | |
| In. MLP-3Adaptation Method=Intermediate MLP-3, Backbone=ViT-L/16, % Trainable parameters=2.8%, Backbone backpropagation=true2023.03 | — | 13.9 | |
| In. MLP-3Backbone=SWIN-L, % Trainable parameters=2.8%, No backbone backpropagation=true2023.03 | — | 9.7 | |
| InCAAdaptation Method=Inductive Cross-Attention, Backbone=ViT-L/16, % Trainable parameters=1.3%, Backbone backpropagation=true2023.03 | — | 8.7 | |
| InCABackbone=SWIN-L, % Trainable parameters=3.7%, No backbone backpropagation=true2023.03 | — | 9.1 | |
| InCA (last)Adaptation Method=InCA on last layer only, Backbone=ViT-L/16, % Trainable parameters=1.3%, Backbone backpropagation=true2023.03 | — | 9.4 | |
| InCA (last)Backbone=SWIN-L, % Trainable parameters=3.7%, No backbone backpropagation=true2023.03 | — | 9.6 | |
| LoRAAdaptation Method=Low-Rank Adaptation, Backbone=ViT-L/16, % Trainable parameters=2.4%, Backbone backpropagation=false2023.03 | — | 12.7 | |
| LoRABackbone=SWIN-L, % Trainable parameters=0.8%, No backbone backpropagation=false2023.03 | — | 10 | |
| LPAdaptation Method=Linear Probing, Backbone=ViT-L/16, % Trainable parameters=0.1%, Backbone backpropagation=true2023.03 | — | 16.2 | |
| LPBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=false2023.03 | — | 10.6 | |
| MLP-3Adaptation Method=MLP-3, Backbone=ViT-L/16, % Trainable parameters=2.8%, Backbone backpropagation=true2023.03 | — | 13.9 | |
| MLP-3Backbone=SWIN-L, % Trainable parameters=2.8%, No backbone backpropagation=false2023.03 | — | 9.7 | |
| VPTAdaptation Method=Visual Prompt Tuning, Backbone=ViT-L/16, % Trainable parameters=0.8%, Backbone backpropagation=false2023.03 | — | 10.4 |