Image Classification on ImageNet-Adversarial
87.3Top-1 AccEVA-CLIP-18B
Evaluation Results
| Method | Links | |
|---|---|---|
| EVA-CLIP-18BZero-shot=true2024.02 | 87.3 | |
| EVA-CLIP-8BZero-shot=true2024.02 | 85.2 | |
| InternVL-CZero-shot=true2024.02 | 83.8 | |
| EVA-02-CLIP-E/14+zero-shot evaluation protocol=true2023.03 | 82.1 | |
| EVA-02-CLIP-E/14+Zero-shot=true2024.02 | 82.1 | |
| DFN5B-CLIP-H/14+Zero-shot=true2024.02 | 79.6 | |
| CLIPModel=ViT-L/14@336, Pre-training Data=WIT-400M, Evaluation Protocol=our eval., Image size=3362022.12 | 78 | |
| CLIPModel=ViT-L/14@336, Pre-training Data=WIT-400M, Image size=3362022.12 | 77.2 | |
| EVA-01-CLIP-g/14+Zero-shot=true2024.02 | 74.1 | |
| EVA-01-CLIP-g/14Zero-shot=true2024.02 | 73.6 | |
| CLIPModel=ViT-L/14, Pre-training Data=WIT-400M, Evaluation Protocol=our eval., Image size=2242022.12 | 71.9 | |
| DFN5B-CLIP-H/14Zero-shot=true2024.02 | 71.7 | |
| OpenCLIP-G/14Zero-shot=true2024.02 | 69.3 | |
| TRACERBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 54.92 | |
| EVA-02-CLIP-B/16zero-shot evaluation protocol=true2023.03 | 54.1 | |
| MERGETUNE + Weight ens.Backbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 52.68 | |
| MERGETUNEBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 51.61 | |
| CaRotBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 51.57 | |
| FLIPModel=ViT-L/14, Pre-training Data=LAION-400M, Image size=2242022.12 | 51.2 | |
| Zero-shot (CLIP)Backbone=CLIP ViT-B/16, Protocol=Zero-shot2026.01 | 50.12 | |
| MERGETUNE + Weight ens.Backbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 50.04 | |
| OpenAI CLIP-B/16zero-shot evaluation protocol=true2023.03 | 50 | |
| ZSBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Zero-Shot2026.05 | 49.95 | |
| Lipsum-FTBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 49.87 | |
| LP-FTBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 49.28 | |
| MERGETUNEBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 49.21 | |
| FLYPBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 48.49 | |
| VRFBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 48.41 | |
| TIESBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 48.32 | |
| OpenCLIPModel=ViT-L/14, Pre-training Data=LAION-400M, Evaluation Protocol=our eval., Image size=2242022.12 | 48.3 | |
| VRFBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 48.08 | |
| Weight ens.Backbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 47.89 | |
| TIESBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 47.81 | |
| DAREBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 47.74 | |
| Weight ens.Backbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 47.61 | |
| Linear ProbingBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 46.48 | |
| CLIPModel=ViT-L/14, Pre-training Data=LAION-400M, Evaluation Protocol=our repro., Image size=2242022.12 | 46.3 | |
| E2E-FTBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 36.62 | |
| DAREBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 35.55 |