Image Classification on Country211
86Top-1 AccMLCD
Evaluation Results
| Method | Links | |
|---|---|---|
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 86 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 85.8 | |
| UNICOMPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 85.4 | |
| CLIP+Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 85.3 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 84.3 | |
| ITO sub2Pre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 80 | |
| PEcore GSize=G2026.02 | 78.2 | |
| PEcore G (image only)Size=G, Input=image only2026.02 | 76.7 | |
| SigLIP2-g-optSize=g2026.02 | 73.6 | |
| DFN-H+2026.02 | 72.5 | |
| SLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 70 | |
| FLAIRPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 70 | |
| ITOPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 70 | |
| PEcore LSize=L2026.02 | 67.8 | |
| SigLIP2-L/16Backbone=SigLIP2-L, Patch Size=162026.02 | 67 | |
| SigLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 60 | |
| EVA 18BSize=18B2026.02 | 59.7 | |
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 57.9 | |
| PEcore BSize=B2026.02 | 57 | |
| CLIPArchitecture=ViT-B/16, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 55.1 | |
| SigLIP2-B/16Backbone=SigLIP2-B, Patch Size=162026.02 | 54.8 | |
| InternVL-C2026.02 | 53.3 | |
| SigLIP-L/16Backbone=SigLIP-L, Patch Size=162026.02 | 53.2 | |
| LaCLIPArchitecture=ViT-B/32, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 52.2 | |
| CLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 50 | |
| CLIPArchitecture=ViT-B/32, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 49.7 | |
| LOUPEevaluation=linear probing2022.08 | 49.3 | |
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=CC12M, Protocol=5-way 5-shot2023.05 | 46.7 | |
| CLIPevaluation=linear probing2022.08 | 46.4 | |
| LaSLIPArchitecture=ViT-B/16, Pre-training Data=CC12M, Protocol=5-way 5-shot2023.05 | 45.4 | |
| CLIPArchitecture=ViT-B/16, Pre-training Data=CC12M, Protocol=5-way 5-shot2023.05 | 44.3 | |
| SigLIP-B/16Backbone=SigLIP-B, Patch Size=162026.02 | 44 | |
| EVA-CLIP-18BZero-shot=true2024.02 | 43.1 | |
| SLIPArchitecture=ViT-B/16, Pre-training Data=CC12M, Protocol=5-way 5-shot2023.05 | 43 | |
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=RedCaps, Protocol=5-way 5-shot2023.05 | 42.6 | |
| EVA-CLIP-8BZero-shot=true2024.02 | 41.7 | |
| CLIPArchitecture=ViT-B/16, Pre-training Data=RedCaps, Protocol=5-way 5-shot2023.05 | 40.6 | |
| MetaCLIP+ViSE2026.02 | 40.137 | |
| Only ViSE2026.02 | 40.137 | |
| KD 2B to ViT-H, M+V+L4Backbone=ViT-H, Distillation=KD 2B, Target=M+V+L42026.02 | 39.66 | |
| DFN5B-CLIP-H/14+Zero-shot=true2024.02 | 37.9 | |
| LOUPEmode=zero-shot2022.08 | 37.8 | |
| CLIPArchitecture=ViT-B/16, Pre-training Data=CC3M, Protocol=5-way 5-shot2023.05 | 37.3 | |
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=CC3M, Protocol=5-way 5-shot2023.05 | 37.3 | |
| EVA-02-CLIP-E/14+Zero-shot=true2024.02 | 37 | |
| InternVL-CZero-shot=true2024.02 | 35.1 | |
| CLIPmode=zero-shot2022.08 | 34.9 | |
| OpenCLIP-G/14Zero-shot=true2024.02 | 34.9 | |
| DFN5B-CLIP-H/14Zero-shot=true2024.02 | 34.4 | |
| KD 2B to ViT-H, ViseBackbone=ViT-H, Distillation=KD 2B, Target=Vise2026.02 | 34.29 | |
| CLIP (reported)Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 32.7 | |
| EVA-01-CLIP-g/14+Zero-shot=true2024.02 | 31.8 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 30.9 | |
| CLIPLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 30.1 | |
| DaVinciLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 29.9 | |
| FLAVALinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 28.9 | |
| EVA-01-CLIP-g/14Zero-shot=true2024.02 | 28.9 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 27.9 | |
| xCLIPLinear probing=true, Backbone=ViT-B/16, Pre-train=IT35M2022.10 | 26.3 | |
| X-FM_baseLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 24.9 | |
| CLIPLinear probing=true, Backbone=ViT-B/16, Pre-train=IT35M2022.10 | 23.2 | |
| FLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 23.1 | |
| nCLIPLinear probing=true, Backbone=ViT-B/16, Pre-train=IT35M2022.10 | 22.7 | |
| ITOPre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 21.8 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 21.6 | |
| CLIPPre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 21.4 | |
| ITO sub2Pre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 21 | |
| OpenCLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 20.3 | |
| ITOBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 20.3 | |
| CLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 20.2 | |
| ITO sub2Backbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 19.1 | |
| CLIPBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 19 | |
| CLIP-MapbaseImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 18.6 | |
| TinyCLIPImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 18.3 | |
| Standard CLIPEvaluation Protocol=zero-shot2024.11 | 15 | |
| ITOZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 13.9 | |
| CLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 13.5 | |
| B-cosified RN-50 CLIPPre-training Dataset=CC3M [47], Learning Scheduler=Cyclic, Evaluation Protocol=zero-shot2024.11 | 13 | |
| CLIP-MapsmallImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 12.5 | |
| B-cosified RN-50 CLIPPre-training Dataset=ImageNet [16], Learning Scheduler=Cosine, Evaluation Protocol=zero-shot2024.11 | 12 | |
| B-cosified RN-50 CLIPPre-training Dataset=ImageNet [16], Learning Scheduler=Cyclic, Evaluation Protocol=zero-shot2024.11 | 12 | |
| B-cosified RN-50 CLIPPre-training Dataset=CC3M [47], Learning Scheduler=Cosine, Evaluation Protocol=zero-shot2024.11 | 12 | |
| †TinyCLIPImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 11.7 | |
| SLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 11.5 | |
| xCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 9.3 | |
| CLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 9.1 | |
| ITO sub2Pre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 7.8 | |
| FLAIRPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 6.2 | |
| nCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 5.8 | |
| ITOPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 5.7 | |
| HyCoCLIPw/ boxes=true2025.10 | 5.64 | |
| PHyCLIPw/ boxes=true2025.10 | 5.56 | |
| CLIP-MaptinyImage Encoder=ViT-0.8M/16, Zero-shot=true2026.02 | 5.5 | |
| SLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 5.4 | |
| CLIPw/ boxes=false2025.10 | 5.13 | |
| CLIPw/ boxes=true2025.10 | 5.1 | |
| MERUw/ boxes=true2025.10 | 5.01 | |
| SigLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 5 | |
| †TinyCLIPImage Encoder=ViT-0.8M/16, Zero-shot=true2026.02 | 4.9 | |
| MERUw/ boxes=false2025.10 | 4.86 |