Zero-shot Image Classification on ImageNet zero-shot
83.5Top-1 AccuracyEVA-CLIP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EVA-CLIPBackbone=18B, Data size=2.7B2024.12 | 83.5 | 97.2 | |
| ViTamin-LEncoder Size(M)=333, Input Res.=224, Latency Enc.(ms)=38.1, Hardware=M1 Macbook Pro, Zero-Shot evaluation protocol=true2024.12 | 80.8 | — | |
| ViT-L/14Encoder Size(M)=304, Input Res.=224, Latency Enc.(ms)=47.2, Hardware=M1 Macbook Pro, Zero-Shot evaluation protocol=true2024.12 | 79.2 | — | |
| FastViTHDEncoder Size(M)=125, Input Res.=224, Latency Enc.(ms)=6.8, Hardware=M1 Macbook Pro, Zero-Shot evaluation protocol=true2024.12 | 78.3 | — | |
| ConvNeXt-LEncoder Size(M)=200, Input Res.=320, Latency Enc.(ms)=34.4, Hardware=M1 Macbook Pro, Zero-Shot evaluation protocol=true2024.12 | 76.8 | — | |
| CLIPBackbone=ViT-L, Data size=400M2024.12 | 74 | 94 | |
| BiFTABackbone=ViT-B/16, Zero-shot=true2026.01 | 71.14 | — | |
| WCABackbone=ViT-B/16, Zero-shot=true2026.01 | 71.05 | — | |
| VladVABackbone=Qwen2-VL-2B, Data size=8.1M2024.12 | 70.6 | 91.1 | |
| CuPLBackbone=ViT-B/16, Zero-shot=true2026.01 | 69.61 | — | |
| CLIPBackbone=ViT-B, Data size=400M2024.12 | 68.4 | 91.9 | |
| CLIP-EBackbone=ViT-B/16, Zero-shot=true2026.01 | 68.37 | — | |
| WaffleBackbone=ViT-B/16, Zero-shot=true2026.01 | 68.12 | — | |
| CLIP-DBackbone=ViT-B/16, Zero-shot=true2026.01 | 68.04 | — | |
| CLIPBackbone=ViT-B/16, Zero-shot=true2026.01 | 66.74 | — | |
| VladVABackbone=LLAVA-1.5-7B, Data size=8.1M2024.12 | 63.7 | 88.3 | |
| Full-precisionQuant Setup=Vision, #Bits=32/32, Size (MB)=607.22024.11 | 63.4 | — | |
| Full-precisionQuant Setup=Vision & Text, #Bits=32/32, Size (MB)=607.22024.11 | 63.4 | — | |
| RepQ-ViT + QwTQuant Setup=Vision, #Bits=8/8, Size (MB)=359.52024.11 | 63 | — | |
| RepQ-ViTQuant Setup=Vision, #Bits=8/8, Size (MB)=345.32024.11 | 62.9 | — | |
| RepQ-ViT + QwTQuant Setup=Vision, #Bits=6/6, Size (MB)=336.82024.11 | 60.3 | — | |
| RepQ-ViTQuant Setup=Vision, #Bits=6/6, Size (MB)=323.52024.11 | 59.2 | — | |
| Qwen2-VL-2BData size=0M2024.12 | 54.7 | 79.4 | |
| RepQ-ViT + QwTQuant Setup=Vision & Text, #Bits=8/8, Size (MB)=252.62024.11 | 54.6 | — | |
| BLIPBackbone=ViT-L, Data size=129M2024.12 | 54.2 | 81.5 | |
| FFFBackbone=ViT-B, Data size=15M2024.12 | 51.1 | — | |
| E5-VBackbone=LLAVA-Next-8B, Data size=0M2024.12 | 48.2 | 76.6 | |
| BLIP2Backbone=ViT-L, Data size=129M2024.12 | 46.7 | 74.2 | |
| HiDeCLIPBackbone=ViT-B, Data size=15M2024.12 | 45.9 | — | |
| LLaVA-Next-8BData size=0M2024.12 | 45.8 | 74.6 | |
| RepQ-ViT + QwTQuant Setup=Vision & Text, #Bits=6/6, Size (MB)=221.32024.11 | 43.5 | — | |
| LLaVA-1.5-7BData size=0M2024.12 | 42 | 74.6 | |
| RepQ-ViTQuant Setup=Vision & Text, #Bits=8/8, Size (MB)=232.12024.11 | 38.7 | — | |
| CLIPBackbone=ViT-B, Data size=15M2024.12 | 32.8 | — | |
| RepQ-ViTQuant Setup=Vision & Text, #Bits=6/6, Size (MB)=200.82024.11 | 29.8 | — |