Classification on Caltech101
97.6AccuracyFLYP
Evaluation Results
| Method | Links | |
|---|---|---|
| FLYPEvaluation Protocol=Fine-tuning2022.12 | 97.6 | |
| FTEvaluation Protocol=Fine-tuning2022.12 | 97.2 | |
| LP-FTEvaluation Protocol=Linear Probing then Fine-tuning2022.12 | 96.9 | |
| ProposedShots=16, Venue=-2025.12 | 96.2 | |
| TPTBackbone=ViT-B/162026.06 | 94.96 | |
| LPEvaluation Protocol=Linear Probing2022.12 | 94.8 | |
| USEBackbone=ResNet50, Optim.=true2026.07 | 87.95 | |
| RLCFBackbone=ResNet50, Optim.=true2026.07 | 87.83 | |
| TPTBackbone=ResNet50, Optim.=true2026.07 | 87.77 | |
| SEBackbone=ResNet50, Optim.=false2026.07 | 87.75 | |
| ZeroshotEvaluation Protocol=Zero-shot2022.12 | 87.7 | |
| MTABackbone=ResNet50, Optim.=false2026.07 | 87.46 | |
| C-TPTBackbone=ResNet50, Optim.=true2026.07 | 87.34 | |
| TPTBackbone=ResNet-502026.06 | 87.02 | |
| TPSBackbone=ResNet50, Optim.=true2026.07 | 86.96 | |
| STSBackbone=ResNet50, Optim.=true2026.07 | 86.63 | |
| CLIPShots=0, Venue=ICML’222025.12 | 86.5 | |
| ZEROBackbone=ResNet50, Optim.=false2026.07 | 86.43 | |
| R-TPTBackbone=ResNet50, Optim.=true2026.07 | 86.13 | |
| CLIPBackbone=ResNet50, Optim.=false2026.07 | 85.88 | |
| LSA+OnZetaBackbone=ViT-B/162026.06 | 84.72 | |
| LSABackbone=ViT-B/162026.06 | 84.46 | |
| CLIP baselineBackbone=ViT-B/162026.06 | 83.91 | |
| OnZetaBackbone=ViT-B/162026.06 | 83.86 | |
| Noun SubmanifoldBackbone=CLIP ViT-L-14, zero-shot=true2023.05 | 82.8 | |
| CLIPBackbone=CLIP, Expansion Ratio=1x, Evaluation Protocol=Zero-shot2022.11 | 82.1 | |
| CLIPBackbone=CLIP ViT-L-14, zero-shot=true2023.05 | 80.9 | |
| POS PCABackbone=CLIP ViT-L-14, zero-shot=true2023.05 | 80.9 | |
| POS PGABackbone=CLIP ViT-L-14, zero-shot=true2023.05 | 80.8 | |
| LSA+OnZetaBackbone=ResNet-502026.06 | 79.63 | |
| OnZetaBackbone=ResNet-502026.06 | 79.39 | |
| CLIP baselineBackbone=ResNet-502026.06 | 79.14 | |
| LSABackbone=ResNet-502026.06 | 78.82 | |
| xCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 73.9 | |
| E-CLIPImage Encoder=ViT-B/16, Protocol=Zero-shot2025.03 | 73.7 | |
| CLIPImage Encoder=ViT-B/16, Protocol=Zero-shot2025.03 | 73.5 | |
| A-CLIPImage Encoder=ViT-B/16, Protocol=Zero-shot2025.03 | 73.5 | |
| CLIP-PGSImage Encoder=ViT-B/16, p=0.3, Protocol=Zero-shot2025.03 | 72.7 | |
| CLIP-PGSImage Encoder=ViT-B/16, p=0.5, Protocol=Zero-shot2025.03 | 71.8 | |
| CLIP-PGSImage Encoder=ViT-S/16, p=0.3, Protocol=Zero-shot2025.03 | 71.8 | |
| CLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 71.3 | |
| FLIPImage Encoder=ViT-B/16, Protocol=Zero-shot2025.03 | 70.4 | |
| CLIP-PGSImage Encoder=ViT-S/16, p=0.5, Protocol=Zero-shot2025.03 | 69.4 | |
| GIF-SDBackbone=ResNet-50, Expansion Method=GIF-SD, Expansion Ratio=20x, Evaluation Protocol=Train from scratch2022.11 | 65.1 | |
| nCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 65 | |
| GIF-DALLEBackbone=ResNet-50, Expansion Method=GIF-DALLE, Expansion Ratio=20x, Evaluation Protocol=Train from scratch2022.11 | 63 | |
| DALL-E2Backbone=ResNet-50, Expansion Method=DALL-E2, Expansion Ratio=20x, Evaluation Protocol=Train from scratch2022.11 | 61.3 | |
| FLQMIAAlignment=frozen pretrained DINOv2 and GTE-1.5, Setting=Zero-shot2026.05 | 59.06 | |
| GIF-MAEBackbone=ResNet-50, Expansion Method=GIF-MAE, Expansion Ratio=20x, Evaluation Protocol=Train from scratch2022.11 | 58.4 | |
| SAIL w/ SigLIPAlignment=frozen pretrained DINOv2 and GTE-1.5, Loss=SigLIP, Setting=Zero-shot2026.05 | 58.23 | |
| RandAugmentBackbone=ResNet-50, Expansion Method=RandAugment, Expansion Ratio=20x, Evaluation Protocol=Train from scratch2022.11 | 57.8 | |
| SAIL w/ CLIPAlignment=frozen pretrained DINOv2 and GTE-1.5, Loss=InfoNCE, Setting=Zero-shot2026.05 | 55.66 | |
| FLVMIAAlignment=frozen pretrained DINOv2 and GTE-1.5, Setting=Zero-shot2026.05 | 53.3 | |
| GridMaskBackbone=ResNet-50, Expansion Method=GridMask, Expansion Ratio=20x, Evaluation Protocol=Train from scratch2022.11 | 51.6 | |
| CutoutBackbone=ResNet-50, Expansion Method=Cutout, Expansion Ratio=20x, Evaluation Protocol=Train from scratch2022.11 | 51.5 | |
| SDBackbone=ResNet-50, Expansion Method=SD, Expansion Ratio=20x, Evaluation Protocol=Train from scratch2022.11 | 51.1 | |
| MAEBackbone=ResNet-50, Expansion Method=MAE, Expansion Ratio=20x, Evaluation Protocol=Train from scratch2022.11 | 50.6 | |
| CSAAlignment=frozen pretrained DINOv2 and GTE-1.5, Method=Analytical (CCA), Setting=Zero-shot2026.05 | 46.28 | |
| Distillation of CLIPBackbone=ResNet-50, Expansion Ratio=1x, Evaluation Protocol=Knowledge Distillation2022.11 | 33.2 | |
| OriginalBackbone=ResNet-50, Expansion Ratio=1x, Evaluation Protocol=Train from scratch2022.11 | 26.3 |