Image Classification on FGVC Aircraft (Acc., ECE)
81.4AccuracySwin-S
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Swin-SBackbone=Swin-S, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 81.4 | — | — | |
| ResNet-101Backbone=ResNet-101, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 81.4 | — | — | |
| Swin-TiBackbone=Swin-Ti, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 81.1 | — | — | |
| ResNet-50Backbone=ResNet-50, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 80.3 | — | — | |
| DeiT-BBackbone=DeiT-B, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 79.3 | — | — | |
| ViT-BBackbone=ViT-B, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 79 | — | — | |
| DeiT-LBackbone=DeiT-L, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 78.8 | — | — | |
| ViT-SBackbone=ViT-S, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 78.6 | — | — | |
| ResNet-101Backbone=ResNet-101, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 78.4 | — | — | |
| ResNet-50Backbone=ResNet-50, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 78.2 | — | — | |
| ViT-LBackbone=ViT-L, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 77.6 | — | — | |
| DeiT-BBackbone=DeiT-B, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 77 | — | — | |
| Swin-TiBackbone=Swin-Ti, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 77 | — | — | |
| DeiT-SBackbone=DeiT-S, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 76.8 | — | — | |
| Swin-SBackbone=Swin-S, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 75.7 | — | — | |
| DeiT-SBackbone=DeiT-S, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 75.3 | — | — | |
| DeiT-LBackbone=DeiT-L, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 72.8 | — | — | |
| ViT-SBackbone=ViT-S, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 72.4 | — | — | |
| ViT-LBackbone=ViT-L, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 72.1 | — | — | |
| ViT-BBackbone=ViT-B, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 71.7 | — | — | |
| PS-CBMBackbone=CLIP ViT-L/142025.11 | 65.1 | 48.5 | — | |
| VLG-CBMBackbone=CLIP ViT-L/142025.11 | 63.5 | 48.3 | — | |
| Linear ProbeBackbone=CLIP ViT-L/142025.11 | 62.9 | — | — | |
| DN-CBMBackbone=CLIP ViT-L/142025.11 | 62.9 | 43.2 | — | |
| LaBoBackbone=CLIP ViT-L/142025.11 | 61.4 | 42.4 | — | |
| V2C-CBMBackbone=CLIP ViT-L/142025.11 | 57.9 | 40 | — | |
| DCBMBackbone=CLIP ViT-L/142025.11 | 57.9 | 41.2 | — | |
| LM4CVBackbone=CLIP ViT-L/142025.11 | 54.7 | 40.9 | — | |
| Res-CBMBackbone=CLIP ViT-L/142025.11 | 54.4 | 42.7 | — | |
| LF-CBMBackbone=CLIP ViT-L/142025.11 | 53.2 | 42.3 | — | |
| PS-CBMBackbone=CLIP RN502025.11 | 47 | — | 34.9 | |
| VLG-CBMBackbone=CLIP RN502025.11 | 45.6 | — | 34.6 | |
| Linear ProbeBackbone=CLIP RN502025.11 | 42.5 | — | — | |
| DN-CBMBackbone=CLIP RN502025.11 | 42.1 | — | 28.7 | |
| LaBoBackbone=CLIP RN502025.11 | 40.3 | — | 27.9 | |
| LM4CVBackbone=CLIP RN502025.11 | 38.5 | — | 28.8 | |
| V2C-CBMBackbone=CLIP RN502025.11 | 37.1 | — | 25.6 | |
| Res-CBMBackbone=CLIP RN502025.11 | 36.9 | — | 28.9 | |
| DCBMBackbone=CLIP RN502025.11 | 36.4 | — | 25.8 | |
| LF-CBMBackbone=CLIP RN502025.11 | 36.2 | — | 28.9 | |
| TPTBackbone=ViT-L/142026.01 | 31.8 | 28.8 | — | |
| C-TPTBackbone=ViT-L/142026.01 | 30.9 | 21.4 | — | |
| SoCBackbone=ViT-L/142026.01 | 30.9 | 12.7 | — | |
| O-TPTBackbone=ViT-L/142026.01 | 30 | 16.8 | — | |
| Zero-ShotBackbone=ViT-L/142026.01 | 29.9 | 10.3 | — | |
| C-TPTBackbone=CLIP-ViTB/162025.03 | 24.85 | 4.36 | — | |
| MaPLe+TPTBackbone=CLIP-ViT/B16, Prompt Initialization Source=MaPLe, Adaptation Framework=TPT, Adaptation Strategy=TPT2026.04 | 24.36 | 10.58 | — | |
| MaPLe+FPPBackbone=CLIP-ViT/B16, Prompt Initialization Source=MaPLe, Adaptation Framework=TPT, Adaptation Strategy=FPP2026.04 | 24.06 | 3.98 | — | |
| MaPLe+O-TPTBackbone=CLIP-ViT/B16, Prompt Initialization Source=MaPLe, Adaptation Framework=TPT, Adaptation Strategy=O-TPT2026.04 | 24 | 6.41 | — | |
| Robust-adapt-SaLs-CTPTBackbone=CLIP-ViTB/162025.03 | 23.94 | 6.21 | — | |
| Robust-adapt-Penalty-CTPTBackbone=CLIP-ViTB/162025.03 | 23.91 | 4.43 | — | |
| Zero ShotBackbone=CLIP-ViTB/162025.03 | 23.9 | 5.11 | — | |
| Robust-adapt-ZS-CTPTBackbone=CLIP-ViTB/162025.03 | 23.88 | 4.31 | — | |
| O-TPTBackbone=CLIP-ViTB/162025.03 | 23.64 | 3.68 | — | |
| TPTBackbone=CLIP-ViTB/162025.03 | 23.4 | 16.8 | — | |
| CoOp+FPPBackbone=CLIP-ViT/B16, Prompt Initialization Source=CoOp, Adaptation Framework=TPT, Adaptation Strategy=FPP2026.04 | 21.51 | 9.34 | — | |
| CoOp+TPTBackbone=CLIP-ViT/B16, Prompt Initialization Source=CoOp, Adaptation Framework=TPT, Adaptation Strategy=TPT2026.04 | 20 | 29.6 | — | |
| CoOp+C-TPTBackbone=CLIP-ViT/B16, Prompt Initialization Source=CoOp, Adaptation Framework=TPT, Adaptation Strategy=C-TPT2026.04 | 19.2 | 21.5 | — | |
| CoOp+O-TPTBackbone=CLIP-ViT/B16, Prompt Initialization Source=CoOp, Adaptation Framework=TPT, Adaptation Strategy=O-TPT2026.04 | 18.69 | 16.82 | — |