Image Classification on vtab pets
97.339AccuracyMetaCLIP+ViSE
Evaluation Results
| Method | Links | |
|---|---|---|
| MetaCLIP+ViSE2026.02 | 97.339 | |
| Only ViSE2026.02 | 97.339 | |
| KD 2B to ViT-H, ViseBackbone=ViT-H, Distillation=KD 2B, Target=Vise2026.02 | 96.81 | |
| KD 2B to ViT-H, M+V+L4Backbone=ViT-H, Distillation=KD 2B, Target=M+V+L42026.02 | 96.4 | |
| SigLIP2-B/16Backbone=SigLIP2-B, Patch Size=162026.02 | 95.4 | |
| PEcore BSize=B2026.02 | 94.6 | |
| SigLIP-B/16Backbone=SigLIP-B, Patch Size=162026.02 | 94.2 | |
| Standard CLIPEvaluation Protocol=zero-shot2024.11 | 86 | |
| B-cosified RN-50 CLIPPre-training Dataset=ImageNet [16], Learning Scheduler=Cyclic, Evaluation Protocol=zero-shot2024.11 | 85 | |
| B-cosified RN-50 CLIPPre-training Dataset=ImageNet [16], Learning Scheduler=Cosine, Evaluation Protocol=zero-shot2024.11 | 83 | |
| B-cosified RN-50 CLIPPre-training Dataset=CC3M [47], Learning Scheduler=Cyclic, Evaluation Protocol=zero-shot2024.11 | 81 | |
| B-cosified RN-50 CLIPPre-training Dataset=CC3M [47], Learning Scheduler=Cosine, Evaluation Protocol=zero-shot2024.11 | 80 | |
| PEcore GSize=G2026.02 | 78.2 | |
| PEcore G (image only)Size=G, Input=image only2026.02 | 76.7 | |
| SigLIP2-g-optSize=g2026.02 | 73.6 | |
| DFN-H+2026.02 | 72.5 | |
| Text2ConceptEvaluation Protocol=zero-shot2024.11 | 69 | |
| PEcore LSize=L2026.02 | 67.8 | |
| SigLIP2-L/16Backbone=SigLIP2-L, Patch Size=162026.02 | 67 | |
| EVA 18BSize=18B2026.02 | 59.7 | |
| InternVL-C2026.02 | 53.3 | |
| SigLIP-L/16Backbone=SigLIP-L, Patch Size=162026.02 | 53.2 |