Image Classification on Pets (Top-1 accuracy)
95.4Top-1 AccuracyCapPa L/14
Evaluation Results
| Method | Links | |
|---|---|---|
| CapPa L/14MAP head=true, Grain=Fine, Frozen representation=true, backbone=ViT-L/142023.06 | 95.4 | |
| OSTBProtocol=Final Ensemble2026.06 | 95.2 | |
| OriginalBackbone=DeiT-B, P. Budget=100, Comp. Ratio=–2024.11 | 94.74 | |
| OursShots=16, Backbone=ViT-B/16, Seeds=32025.12 | 94.6 | |
| FiPS+RigL FTBackbone=DeiT-B, P. Budget=40%, Comp. Ratio=(∼33%)2024.11 | 94.52 | |
| FiPS+RigL FTBackbone=DeiT-B, P. Budget=50%, Comp. Ratio=(∼25%)2024.11 | 94.41 | |
| CapPaMAP head=true, Grain=Fine, Frozen representation=true2023.06 | 94.4 | |
| CLIP* L/14MAP head=true, Grain=Fine, Frozen representation=true, backbone=ViT-L/142023.06 | 94.4 | |
| GFMBackbone=DeiT-B, P. Budget=50%, Comp. Ratio=(∼25%)2024.11 | 94.22 | |
| OursShots=8, Backbone=ViT-B/16, Seeds=32025.12 | 94.2 | |
| FiPS+RigL FTBackbone=DeiT-B, P. Budget=25%, Comp. Ratio=(∼45%)2024.11 | 94.19 | |
| GFMBackbone=DeiT-B, P. Budget=40%, Comp. Ratio=(∼33%)2024.11 | 93.95 | |
| OursShots=4, Backbone=ViT-B/16, Seeds=32025.12 | 93.7 | |
| LlipData Size=2.5B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 93.5 | |
| OursShots=1, Backbone=ViT-B/16, Seeds=32025.12 | 92.9 | |
| Image-TextIntra-modal=✗, Classifier=Zero-Shot, Backbone=ViT-B/16-open2026.03 | 92.8 | |
| OursShots=2, Backbone=ViT-B/16, Seeds=32025.12 | 91.9 | |
| MetaCLIPData Size=2.5B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 91.7 | |
| StableRepPre-training Data Source=Synthetic, Evaluation Protocol=5-way, 5-shot2023.06 | 91.7 | |
| CLIPPre-training Data Source=Synthetic, Evaluation Protocol=5-way, 5-shot2023.06 | 91.5 | |
| CapMAP head=true, Grain=Fine, Frozen representation=true2023.06 | 91.5 | |
| CLIP* (8k)MAP head=true, Grain=Fine, Frozen representation=true2023.06 | 91.2 | |
| CLIP* (16k)MAP head=true, Grain=Fine, Frozen representation=true2023.06 | 91.2 | |
| CLIPPre-training Data Source=Real, Evaluation Protocol=5-way, 5-shot2023.06 | 91.1 | |
| IsoCLIPIntra-modal=✓, Classifier=NCM, Backbone=ViT-B/16-open2026.03 | 90.6 | |
| OpenCLIPData Size=2B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 89.5 | |
| Image-ImageIntra-modal=✓, Classifier=NCM, Backbone=ViT-B/16-open2026.03 | 88.9 | |
| CLIP-B/32Backbone=CLIP-B/32, Protocol=Zero-shot2026.06 | 87.44 | |
| ITOZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 83.6 | |
| CLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 82.7 | |
| SimCLRPre-training Data Source=Synthetic, Evaluation Protocol=5-way, 5-shot2023.06 | 74.6 | |
| SimCLRPre-training Data Source=Real, Evaluation Protocol=5-way, 5-shot2023.06 | 74.4 | |
| SLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 74.3 | |
| DreamLIPData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 64.1 | |
| FLAIRData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 55.6 | |
| PHyCLIPw/ boxes=true2025.10 | 54.18 | |
| HyCoCLIPw/ boxes=true2025.10 | 53.33 | |
| SigLIPData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 53.3 | |
| CLIPData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 49.3 | |
| CLIPw/ boxes=true2025.10 | 46.19 | |
| CLIPw/ boxes=false2025.10 | 45.89 | |
| CyCLIPProtocol=Linear probing2026.05 | 44.2 | |
| DINORANKCLIPProtocol=Linear probing2026.05 | 43.5 | |
| MERUw/ boxes=false2025.10 | 43.36 | |
| MERUw/ boxes=true2025.10 | 43.22 | |
| ALIPProtocol=Linear probing2026.05 | 41.9 | |
| RANKCLIPProtocol=Linear probing2026.05 | 40.6 | |
| CLIPProtocol=Linear probing2026.05 | 40.4 | |
| FLAIRData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 34.2 | |
| MLLM-AData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 32.1 | |
| DreamLIPData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 27.4 | |
| CLIPData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 22.1 | |
| SigLIPData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 20.6 | |
| LaCLIPData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 15.6 |