Image Classification on ImageNet Multilingual (EN, DE, FR, JP, RU)
75.6Accuracy (EN)openai/clip-vit-large-patch14
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| openai/clip-vit-large-patch14Training Data Scope=English-only, Backbone=ViT-L-142024.09 | 75.6 | 46.7 | 49.6 | 6.6 | 3.5 | 36.4 | |
| DINOv2-MpNetTraining Data Scope=English-only2024.09 | 73.4 | 61.6 | 58.3 | 43.2 | 49.3 | 57.1 | |
| ViT-L-14@laion400mTraining Data Scope=English-only, Backbone=ViT-L-14, Data=LAION-400M2024.09 | 72.3 | 48.2 | 49.9 | 2.7 | 4.5 | 35.5 | |
| xlm-roberta-base-ViT-B-32@laion5bTraining Data Scope=Multilingual, Backbone=ViT-B-32, Data=LAION-5B2024.09 | 63 | 55.8 | 53.8 | 37.3 | 40.3 | 50 | |
| M-CLIP/XLM-Roberta-Large-Vit-L-14Training Data Scope=Multilingual, Backbone=ViT-L-142024.09 | 54.7 | 51.9 | 51.6 | 37.2 | 47.4 | 48.6 | |
| M-CLIP/XLM-Roberta-Large-Vit-B-16PlusTraining Data Scope=Multilingual, Backbone=ViT-B-16Plus2024.09 | 48 | 46.1 | 45.4 | 32.9 | 40.3 | 42.5 | |
| M-CLIP/XLM-Roberta-Large-Vit-B-32Training Data Scope=Multilingual, Backbone=ViT-B-322024.09 | 46.2 | 43.3 | 43.3 | 31.6 | 38.8 | 40.6 | |
| nllb-clip-large@v1Training Data Scope=Multilingual2024.09 | 39.1 | 36.2 | 36 | 32 | 33.9 | 35.4 | |
| nllb-clip-base@v1Training Data Scope=Multilingual2024.09 | 25.4 | 23.3 | 23.9 | 21.7 | 23 | 23.5 |