Image Classification on ImageNet Rendition
95.7Top-1 AccuracyInternVL-C
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InternVL-CZero-shot=true2024.02 | 95.7 | — | |
| EVA-CLIP-18BZero-shot=true2024.02 | 95.7 | — | |
| EVA-CLIP-8BZero-shot=true2024.02 | 95.3 | — | |
| EVA-02-CLIP-E/14+Zero-shot=true2024.02 | 94.7 | — | |
| DFN5B-CLIP-H/14+Zero-shot=true2024.02 | 93.6 | — | |
| DFN5B-CLIP-H/14Zero-shot=true2024.02 | 92.9 | — | |
| OpenCLIP-G/14Zero-shot=true2024.02 | 92.8 | — | |
| EVA-01-CLIP-g/14+Zero-shot=true2024.02 | 92.7 | — | |
| EVA-01-CLIP-g/14Zero-shot=true2024.02 | 92.5 | — | |
| CLIPModel=ViT-L/14@336, Pre-training Data=WIT-400M, Evaluation Protocol=our eval., Image size=3362022.12 | 89 | — | |
| CLIPModel=ViT-L/14@336, Pre-training Data=WIT-400M, Image size=3362022.12 | 88.9 | — | |
| CLIPModel=ViT-L/14, Pre-training Data=WIT-400M, Evaluation Protocol=our eval., Image size=2242022.12 | 86.8 | — | |
| FLIPModel=ViT-L/14, Pre-training Data=LAION-400M, Image size=2242022.12 | 86.5 | — | |
| CLIPModel=ViT-L/14, Pre-training Data=LAION-400M, Evaluation Protocol=our repro., Image size=2242022.12 | 84.7 | — | |
| OpenCLIPModel=ViT-L/14, Pre-training Data=LAION-400M, Evaluation Protocol=our eval., Image size=2242022.12 | 84.3 | — | |
| TRACERBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 79.33 | — | |
| TRACERBackbone=ViT-B/162026.05 | 79.3 | 65.46 | |
| VRFBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 78.72 | — | |
| MERGETUNE + Weight ens.Backbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 78.68 | — | |
| MERGETUNEBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 78.01 | — | |
| ViT-B/16Architecture=ViT-B/16, Zero-shot=true2026.03 | 77.9 | — | |
| CaRotBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 77.74 | — | |
| CaRotBackbone=ViT-B/162026.05 | 77.74 | 64.03 | |
| ZSBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Zero-Shot2026.05 | 77.71 | — | |
| ZSBackbone=ViT-B/162026.05 | 77.71 | 59.46 | |
| Zero-shot (CLIP)Backbone=CLIP ViT-B/16, Protocol=Zero-shot2026.01 | 77.6 | — | |
| MERGETUNE + Weight ens.Backbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 76.69 | — | |
| MERGETUNEBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 75.98 | — | |
| Lipsum-FTBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 75.93 | — | |
| Lipsum-FTBackbone=ViT-B/162026.05 | 75.93 | 62.7 | |
| ARFBackbone=ViT-B/162026.05 | 75.63 | 62.63 | |
| CAR-FTBackbone=ViT-B/162026.05 | 75.37 | 62.98 | |
| Weight ens.Backbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 75.13 | — | |
| TIESBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 74.48 | — | |
| VRFBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 73.87 | — | |
| TIESBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 73.78 | — | |
| DAREBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 73.11 | — | |
| Weight ens.Backbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 73 | — | |
| Static SDBackbone=ViT-B/162026.05 | 72.87 | 59.55 | |
| LP-FTBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 72.81 | — | |
| Model StockBackbone=ViT-B/162026.05 | 71.77 | 62.4 | |
| FLYPBackbone=ViT-B/16, Pre-trained Model=CLIP, Mode=Finetuning2026.05 | 71.32 | — | |
| FLYPBackbone=ViT-B/162026.05 | 71.32 | 60.61 | |
| Linear ProbingBackbone=CLIP ViT-B/16, Protocol=Linear Probing2026.01 | 71.16 | — | |
| LP-FTBackbone=ViT-B/162026.05 | 70.44 | 59.38 | |
| L2-SPBackbone=ViT-B/162026.05 | 68.77 | 57.34 | |
| Direct FTBackbone=ViT-B/162026.05 | 68.53 | 57.08 | |
| CLIP-RDArchitecture=ResNet-50, Zero-shot=true, Distillation Method=CLIP-RD2026.03 | 66.9 | — | |
| CLIP-KDArchitecture=ResNet-50, Zero-shot=true, Distillation Method=CLIP-KD2026.03 | 66 | — | |
| E2E-FTBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 65.63 | — | |
| DAREBackbone=CLIP ViT-B/16, Protocol=E2E-FT2026.01 | 65.23 | — | |
| NEOBackbone=ViT-Base, Evaluation Protocol=Test-Time Adaptation2025.10 | 60.3 | — | |
| FOABackbone=ViT-Base, Evaluation Protocol=Test-Time Adaptation2025.10 | 60.2 | — | |
| SurgeonBackbone=ViT-Base, Evaluation Protocol=Test-Time Adaptation2025.10 | 60.2 | — | |
| VOLO-D5HAT=true, Resolution=224x2242022.04 | 59.7 | — | |
| TENTBackbone=ViT-Base, Evaluation Protocol=Test-Time Adaptation2025.10 | 59.4 | — | |
| SARBackbone=ViT-Base, Evaluation Protocol=Test-Time Adaptation2025.10 | 59.3 | — | |
| No AdaptBackbone=ViT-Base, Evaluation Protocol=Test-Time Adaptation2025.10 | 59.2 | — | |
| CoTTABackbone=ViT-Base, Evaluation Protocol=Test-Time Adaptation2025.10 | 59.2 | — | |
| T3ABackbone=ViT-Base, Evaluation Protocol=Test-Time Adaptation2025.10 | 58.7 | — | |
| LAMEBackbone=ViT-Base, Evaluation Protocol=Test-Time Adaptation2025.10 | 58.5 | — | |
| VOLO-D5HAT=false, Resolution=224x2242022.04 | 57.9 | — | |
| CLIP-RDArchitecture=EfficientNet-B0, Zero-shot=true, Distillation Method=CLIP-RD2026.03 | 55.4 | — | |
| Dr. ViTPre-trained=ImageNet-21K, Fine-tuned on=ImageNet, Resolution=384x384, Discrete representation=discrete only2021.11 | 55.26 | — | |
| Dr. ViTPre-trained=ImageNet-21K, Fine-tuned on=ImageNet, Resolution=384x384, Discrete representation=true2021.11 | 54.64 | — | |
| TinyMIMModel Size=ViT-B2023.01 | 54.6 | — | |
| Dr. ViTPre-trained=ImageNet-21K, Fine-tuned on=ImageNet, Resolution=512x512, Discrete representation=true2021.11 | 54.27 | — | |
| VOLO-D1HAT=true, Resolution=224x2242022.04 | 51.9 | — | |
| ViT-BHAT=true, Resolution=224x2242022.04 | 51.3 | — | |
| ViT-BPre-trained=ImageNet-21K, Fine-tuned on=ImageNet, Resolution=384x384, Discrete representation=false2021.11 | 51.23 | — | |
| VOLO-D1HAT=false, Resolution=224x2242022.04 | 50.3 | — | |
| MAEModel Size=ViT-B2023.01 | 50 | — | |
| ViT-BHAT=false, Resolution=224x2242022.04 | 49.6 | — | |
| Swin-BHAT=true, Resolution=224x2242022.04 | 49 | — | |
| Dr. ViTBackbone=ViT-B, Discrete Only=true2021.11 | 48.82 | — | |
| TinyMIMModel Size=ViT-S2023.01 | 48.8 | — | |
| Swin-SHAT=true, Resolution=224x2242022.04 | 46.5 | — | |
| CLIP-RDArchitecture=ResNet-18, Zero-shot=true, Distillation Method=CLIP-RD2026.03 | 46.2 | — | |
| ResNet-50Architecture=ResNet-50, Zero-shot=true2026.03 | 45.9 | — | |
| Swin-BHAT=false, Resolution=224x2242022.04 | 45.8 | — | |
| MAEModel Size=ViT-S2023.01 | 45.6 | — | |
| DeiTModel Size=ViT-B2023.01 | 45.4 | — | |
| Swin-SHAT=false, Resolution=224x2242022.04 | 45.2 | — | |
| ViT-SHAT=true, Resolution=224x2242022.04 | 45.1 | — | |
| CLIP-KDArchitecture=ResNet-18, Zero-shot=true, Distillation Method=CLIP-KD2026.03 | 45 | — | |
| Dr. ViTBackbone=ViT-B, Discrete Only=false2021.11 | 44.77 | — | |
| Dr. ViTBackbone=ViT-B, Resolution=384x3842021.11 | 44.7 | — | |
| Swin-THAT=true, Resolution=224x2242022.04 | 43.8 | — | |
| Dr. ViTBackbone=ViT-S, Discrete Only=true2021.11 | 42.58 | — | |
| DeiTModel Size=ViT-S2023.01 | 42.3 | — | |
| ViT-SHAT=false, Resolution=224x2242022.04 | 41.6 | — | |
| Swin-THAT=false, Resolution=224x2242022.04 | 41.4 | — | |
| TinyMIMModel Size=ViT-T2023.01 | 39.8 | — | |
| EfficientNet-B0Architecture=EfficientNet-B0, Zero-shot=true2026.03 | 39.8 | — | |
| Dr. ViTBackbone=ViT-S, Discrete Only=false2021.11 | 39.02 | — | |
| ViT-BBackbone=ViT-B, Resolution=384x3842021.11 | 38.23 | — | |
| ViT-BBackbone=ViT-B2021.11 | 38.15 | — | |
| MAEModel Size=ViT-T2023.01 | 36.5 | — | |
| ResNet-50Backbone=ResNet-502021.11 | 36.35 | — | |
| Dr. ViTBackbone=MLPMixer, Discrete Only=false2021.11 | 36.27 | — |