Classification on CIFAR-100 Multilingual (13 languages) (test)
66.18Top-1 AccuracyToMCLIP(Lta)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ToMCLIP(Lta)Data Regime=Full data, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 66.18 | 86.35 | 90.89 | |
| ToMCLIP(Ldm)Data Regime=Full data, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 65.92 | 85.88 | 90.44 | |
| ToMCLIPData Regime=Full data, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 65.53 | 85.82 | 90.33 | |
| MCLIPData Regime=Full data, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 64.54 | 85.3 | 89.99 | |
| ToMCLIPData Regime=Low resource, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 53.31 | 74.88 | 82.01 | |
| ToMCLIP(Ldm)Data Regime=Low resource, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 52.33 | 74.68 | 81.84 | |
| ToMCLIP(Lta)Data Regime=Low resource, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 51.42 | 74.47 | 81.97 | |
| ToMCLIPTraining setting=Full data, Zero-shot=true2025.10 | 51.32 | 77.46 | 85.81 | |
| ToMCLIP(Lta)Training setting=Full data, Zero-shot=true2025.10 | 50.73 | 77.12 | 85.73 | |
| MCLIPTraining setting=Full data, Zero-shot=true2025.10 | 50.72 | 76.49 | 84.93 | |
| ToMCLIP(Ldm)Training setting=Full data, Zero-shot=true2025.10 | 50.53 | 75.84 | 84.87 | |
| MCLIPData Regime=Low resource, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 50.24 | 73.5 | 81.17 | |
| ToMCLIPTraining setting=Low resource (1% subset), Zero-shot=true2025.10 | 31.91 | 58.15 | 69.26 | |
| ToMCLIP(Ldm)Training setting=Low resource (1% subset), Zero-shot=true2025.10 | 31.12 | 56.47 | 67.6 | |
| ToMCLIP(Lta)Training setting=Low resource (1% subset), Zero-shot=true2025.10 | 30.45 | 57.14 | 68.26 | |
| MCLIPTraining setting=Low resource (1% subset), Zero-shot=true2025.10 | 30.21 | 56.67 | 67.9 | |
| CLIPData Regime=Low resource, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 24.39 | 35.91 | 42.47 | |
| CLIPData Regime=Full data, Image Backbone=ViT-B/16+, Text Encoder=XLM-RoBERTa2025.10 | 24.39 | 35.91 | 42.47 | |
| CLIPTraining setting=Low resource (1% subset), Zero-shot=true2025.10 | 20.29 | 32.47 | 39.04 | |
| CLIPTraining setting=Full data, Zero-shot=true2025.10 | 20.29 | 32.47 | 39.04 |