Image Classification on FGVC (test)
89.11AccuracyVPT-DEEP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VPT-DEEPTotal parameters=1.18x, Scope: Input=true, Scope: Backbone=true, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 89.11 | 4 | |
| FULLTotal parameters=24.02x, Scope: Input=false, Scope: Backbone=false, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 88.54 | — | |
| BIASTotal parameters=1.05x, Scope: Input=false, Scope: Backbone=true, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 88.41 | 3 | |
| ADAPTERTotal parameters=1.23x, Scope: Input=false, Scope: Backbone=true, Extra parameters=true, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 85.66 | 2 | |
| VPT-SHALLOWTotal parameters=1.04x, Scope: Input=true, Scope: Backbone=false, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 84.62 | 1 | |
| PARTIAL-1Total parameters=3.00x, Scope: Input=false, Scope: Backbone=false, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 82.63 | 0 | |
| LoRA_mul + VPT_add + PACEShot=16, Backbone=ViT-B/16, Pre-trained=ImageNet-21K2024.09 | 81.9 | — | |
| LoRA_mul + VPT_addShot=16, Backbone=ViT-B/16, Pre-trained=ImageNet-21K2024.09 | 81.2 | — | |
| LoRA_add + PACEShot=16, Backbone=ViT-B/16, Pre-trained=ImageNet-21K2024.09 | 80.8 | — | |
| MLP-3Total parameters=1.35x, Scope: Input=false, Scope: Backbone=false, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 79.8 | 0 | |
| LINEARTotal parameters=1.02x, Scope: Input=false, Scope: Backbone=false, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 79.32 | 0 | |
| LoRA_addShot=16, Backbone=ViT-B/16, Pre-trained=ImageNet-21K2024.09 | 78.9 | — | |
| SIDETUNETotal parameters=3.69x, Scope: Input=false, Scope: Backbone=true, Extra parameters=true, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 78.35 | 0 | |
| VPT_add + PACEShot=16, Backbone=ViT-B/16, Pre-trained=ImageNet-21K2024.09 | 77.2 | — | |
| VPT_addShot=16, Backbone=ViT-B/16, Pre-trained=ImageNet-21K2024.09 | 76.7 | — | |
| FullBackbone=ViT-Large, # Params=303M2024.07 | 67.38 | — | |
| C3ABackbone=ViT-Large, Config=b=1024/16, # Params=0.79M2024.07 | 63.8 | — | |
| LoRABackbone=ViT-Large, Rank=r=16, # Params=1.57M2024.07 | 63.64 | — | |
| FullBackbone=ViT-Base, # Params=85.8M2024.07 | 61.6 | — | |
| LoRABackbone=ViT-Base, Rank=r=16, # Params=0.59M2024.07 | 56.64 | — | |
| C3ABackbone=ViT-Base, Config=b=768/12, # Params=0.22M2024.07 | 54.31 | — | |
| ARFCBackbone=SigLip 2 (ViT-B/16), Compression Ratio=50%, Evaluation Protocol=Zero-shot2026.02 | 29 | — | |
| ARFCBackbone=CN-CLIP (ViT-H/14), Compression Ratio=50%, Evaluation Protocol=Zero-shot2026.02 | 26.4 | — | |
| HeadBackbone=ViT-Large2024.07 | 24.62 | — | |
| HeadBackbone=ViT-Base2024.07 | 17.44 | — |