Image Classification on ImageNet-R (Accuracy)
96.6AccuracySigLIP2-g-opt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SigLIP2-g-optSize=g2026.02 | 96.6 | — | |
| PEcore GSize=G2026.02 | 96.5 | — | |
| PEcore G (image only)Size=G, Input=image only2026.02 | 96.1 | — | |
| LiT-22B2026.02 | 96 | — | |
| InternVL-C#Param=6B, Zero-shot=true2025.05 | 95.7 | — | |
| EVA-CLIP-18B#Param=17.5B, Zero-shot=true2025.05 | 95.7 | — | |
| SigLIP2-L/16Backbone=SigLIP2-L, Patch Size=162026.02 | 95.7 | — | |
| InternVL-C2026.02 | 95.7 | — | |
| EVA 18BSize=18B2026.02 | 95.7 | — | |
| EVA 18B+Size=18B, Version=plus2026.02 | 95.6 | — | |
| DenseModel=InternVL-C 6B, Pruning ratio=0%, Evaluation protocol=Zero-shot2026.02 | 95.5 | — | |
| Seed-ViT#Param=532M, Zero-shot=true2025.05 | 95.2 | — | |
| PEcore LSize=L2026.02 | 95.2 | — | |
| SigLIP-L/16Backbone=SigLIP-L, Patch Size=162026.02 | 95 | — | |
| DFN-5B-CLIP-H/14++#Param=632M, Zero-shot=true2025.05 | 94.9 | — | |
| KD 2B to ViT-H, M+V+L4Backbone=ViT-H, Distillation=KD 2B, Target=M+V+L42026.02 | 94.74 | — | |
| MetaCLIP+ViSE2026.02 | 94.458 | — | |
| Only ViSE2026.02 | 94.458 | — | |
| XrayViT=EViT-2B, Backbone Type=Ours, Resolution=336, Active Tokens=2882026.02 | 94.4 | — | |
| Chen et al.ViT=e/14, Backbone Type=Supervised backbones, Evaluation Protocol=Dehghani et al. (2023) protocol (*)2026.02 | 94.3 | — | |
| Dehghani et al.ViT=22B/14, Backbone Type=Supervised backbones, Evaluation Protocol=Dehghani et al. (2023) protocol (*)2026.02 | 94.3 | — | |
| FlattenGPTModel=InternVL-C 6B, Pruning ratio=20%, Evaluation protocol=Zero-shot2026.02 | 93.7 | — | |
| DFN-H+2026.02 | 93.6 | — | |
| KD 2B to ViT-H, ViseBackbone=ViT-H, Distillation=KD 2B, Target=Vise2026.02 | 93.56 | — | |
| OpenCLIP-G/14#Param=1.8B, Zero-shot=true2025.05 | 92.8 | — | |
| MVT + FTArch=ViT-g2025.12 | 92.8 | — | |
| PEcoreViT=G/14, Backbone Type=Weakly-supervised backbones2026.02 | 92.2 | — | |
| SigLIP 2ViT=g/16, Backbone Type=Weakly-supervised backbones2026.02 | 92.2 | — | |
| SigLIP2-B/16Backbone=SigLIP2-B, Patch Size=162026.02 | 91.7 | — | |
| Zhai et al.ViT=G/14, Backbone Type=Supervised backbones, Evaluation Protocol=Dehghani et al. (2023) protocol (*)2026.02 | 91.7 | — | |
| Vanilla FTArch=ViT-g2025.12 | 91.6 | — | |
| EVAArch=ViT-g2025.12 | 91.4 | — | |
| MVTArch=ViT-g2025.12 | 91.4 | — | |
| DINOv3ViT=7B/16, Backbone Type=Self-supervised backbones2026.02 | 91.1 | — | |
| ShortGPTModel=InternVL-C 6B, Pruning ratio=20%, Evaluation protocol=Zero-shot2026.02 | 90.4 | — | |
| BaselineBase Model=SigLIP ViT-B/162026.01 | 90.3 | — | |
| SigLIP-B/16Backbone=SigLIP-B, Patch Size=162026.02 | 90.2 | — | |
| MVT + FTMLLM=MMICL, Backbone=ViT-L2025.12 | 89.5 | — | |
| MVTMLLM=MMICL, Backbone=CLIP ViT-L, Fine-tuned=true2025.12 | 89.5 | — | |
| MVT + FTArch=ViT-L2025.12 | 89.5 | — | |
| MVT + FTMLLM=Otter, Backbone=ViT-L2025.12 | 88.7 | — | |
| MVTMLLM=Otter, Backbone=CLIP ViT-L, Fine-tuned=true2025.12 | 88.7 | — | |
| PEcore BSize=B2026.02 | 88.7 | — | |
| TDAVisual backbone=ViT-L/142025.03 | 88.41 | — | |
| TuneCLIPBase Model=SigLIP ViT-B/162026.01 | 88.33 | — | |
| BCAVisual backbone=ViT-L/142025.03 | 88.27 | — | |
| MVTMLLM=MMICL, Backbone=ViT-L2025.12 | 88.1 | — | |
| MVTMLLM=MMICL, Backbone=CLIP ViT-L2025.12 | 88.1 | — | |
| MVTArch=ViT-L2025.12 | 88.1 | — | |
| Vanilla FTArch=ViT-L2025.12 | 87.5 | — | |
| CLIPVisual backbone=ViT-L/142025.03 | 87.42 | — | |
| VQAArch=ViT-g2025.12 | 87.4 | — | |
| VQAArch=ViT-L2025.12 | 87.3 | — | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot2024.07 | 86.8 | — | |
| CLIPMLLM=None, Backbone=ViT-L2025.12 | 86.6 | — | |
| CLIPMLLM=None, Backbone=CLIP ViT-L2025.12 | 86.6 | — | |
| CLIPArch=ViT-L2025.12 | 86.6 | — | |
| FLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot2024.07 | 86.5 | — | |
| MVTMLLM=Otter, Backbone=ViT-L2025.12 | 85.2 | — | |
| MVTMLLM=Otter, Backbone=CLIP ViT-L2025.12 | 85.2 | — | |
| EVA-CLIPViT=18B/14, Backbone Type=Weakly-supervised backbones2026.02 | 85.2 | — | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot2024.07 | 85.1 | — | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot2024.07 | 84.3 | — | |
| AM-RADIOv2.5ViT=g/14, Backbone Type=Agglomerative backbones2026.02 | 83.8 | — | |
| CAPTShot=16, Backbone=ViT-B/16, Domain Role=Target2026.03 | 83.61 | — | |
| MVTArch=ViT-B/32, Supervisor=MMICL [280]2025.12 | 83 | — | |
| AIMv2ViT=3B/14, Backbone Type=Weakly-supervised backbones2026.02 | 82.3 | — | |
| PROTEUSBackbone=ViT2026.01 | 82.17 | — | |
| ADTEStream Type=Randomized interleaved2026.02 | 81.4 | — | |
| ADTE_randomStream Type=Randomized interleaved, Variant=random2026.02 | 81.2 | — | |
| DINOv2ViT=g/14, Backbone Type=Self-supervised backbones2026.02 | 81.1 | — | |
| MELOBackbone=ViT2026.01 | 78.98 | — | |
| TACShot=16, Backbone=ViT-B/16, Domain Role=Target2026.03 | 78.5 | — | |
| TuneCLIPBase Model=OpenAI ViT-B/162026.01 | 77.86 | — | |
| LwEIBShot=16, Backbone=ViT-B/16, Domain Role=Target2026.03 | 77.81 | — | |
| PromptSRC2025.03 | 77.8 | — | |
| PromptSRC2025.05 | 77.8 | — | |
| BaselineBase Model=OpenAI ViT-B/162026.01 | 77.7 | — | |
| MMRL2025.03 | 77.53 | — | |
| MMRL2025.05 | 77.53 | — | |
| MMRL++2025.05 | 77.43 | — | |
| MMA2025.03 | 77.32 | — | |
| MMA2025.05 | 77.32 | — | |
| MaPLeshot=16-shot, epochs=32026.03 | 77 | — | |
| MaPLe2025.03 | 76.98 | — | |
| MaPLe2025.05 | 76.98 | — | |
| TuneCLIPBase Model=LAION ViT-B/322026.01 | 76.45 | — | |
| BaselineBase Model=LAION ViT-B/322026.01 | 76.43 | — | |
| CoCoOpshot=16-shot, epochs=32026.03 | 76.2 | — | |
| CoCoOp2025.03 | 76.18 | — | |
| Co-CoOp2025.05 | 76.18 | — | |
| OpenCLIPBase Model=LAION ViT-B/322026.01 | 76.05 | — | |
| FastCLIPBase Model=LAION ViT-B/322026.01 | 76.04 | — | |
| Web-DINOViT=7B/14, Backbone Type=Self-supervised backbones2026.02 | 75.6 | — | |
| FastCLIPBase Model=OpenAI ViT-B/162026.01 | 75.41 | — | |
| CoOp2025.03 | 75.21 | — | |
| CoOp2025.05 | 75.21 | — | |
| CoOpShot=16, Backbone=ViT-B/16, Domain Role=Target2026.03 | 75.21 | — | |
| CoOPshot=16-shot, epochs=32026.03 | 75.2 | — | |
| CLIPshot=16-shot, epochs=32026.03 | 74 | — |