Image Classification on SST2 Rendered (top-1 accuracy)
68.4Top-1 AccuracyInternVL-C
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL-CZero-shot=true2024.02 | 68.4 | |
| EVA-CLIP-18BZero-shot=true2024.02 | 67.5 | |
| EVA-CLIP-8BZero-shot=true2024.02 | 66.2 | |
| OpenCLIP-G/14Zero-shot=true2024.02 | 65.3 | |
| EVA-02-CLIP-E/14+Zero-shot=true2024.02 | 62.6 | |
| CLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 60.5 | |
| OpenCLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 59.9 | |
| EVA-01-CLIP-g/14+Zero-shot=true2024.02 | 58.6 | |
| EVA-01-CLIP-g/14Zero-shot=true2024.02 | 58.4 | |
| Standard CLIPEvaluation Protocol=zero-shot2024.11 | 56 | |
| DFN5B-CLIP-H/14+Zero-shot=true2024.02 | 55.5 | |
| DFN5B-CLIP-H/14Zero-shot=true2024.02 | 54.8 | |
| CLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 54.6 | |
| ITOZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 54.4 | |
| ITOBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 53.7 | |
| ITO sub2Pre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 52.4 | |
| ITO sub2Backbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 52 | |
| CLIPBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 51.8 | |
| CLIPPre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 51.3 | |
| SLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 50.6 | |
| ITOPre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 50.5 | |
| ITOPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 50.2 | |
| CLIP-MapsmallImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 50.1 | |
| FLAIRBackbone=ViT-B/16, Pre-training Dataset=CC3M-recap, Evaluation Protocol=Zero-shot2026.03 | 50.1 | |
| ITO sub2Backbone=ViT-B/16, Pre-training Dataset=CC3M-recap, Evaluation Protocol=Zero-shot2026.03 | 50.1 | |
| ITO sub3Backbone=ViT-B/16, Pre-training Dataset=CC3M-recap, Evaluation Protocol=Zero-shot2026.03 | 50.1 | |
| SLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 50.1 | |
| SigLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 50.1 | |
| FLAIRPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 50.1 | |
| ITOPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 50.1 | |
| Text2ConceptEvaluation Protocol=zero-shot2024.11 | 50 | |
| B-cosified RN-50 CLIPPre-training Dataset=ImageNet [16], Learning Scheduler=Cosine, Evaluation Protocol=zero-shot2024.11 | 50 | |
| B-cosified RN-50 CLIPPre-training Dataset=ImageNet [16], Learning Scheduler=Cyclic, Evaluation Protocol=zero-shot2024.11 | 50 | |
| B-cosified RN-50 CLIPPre-training Dataset=CC3M [47], Learning Scheduler=Cosine, Evaluation Protocol=zero-shot2024.11 | 50 | |
| B-cosified RN-50 CLIPPre-training Dataset=CC3M [47], Learning Scheduler=Cyclic, Evaluation Protocol=zero-shot2024.11 | 50 | |
| CLIP-MaptinyImage Encoder=ViT-0.8M/16, Zero-shot=true2026.02 | 50 | |
| †TinyCLIPImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 50 | |
| CLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 50 | |
| ITO sub2Pre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 50 | |
| TinyCLIPImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 49.9 | |
| FLAIRPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 49.9 | |
| ITO sub2Pre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 49.9 | |
| CLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 49.9 | |
| SigLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 49.6 | |
| †TinyCLIPImage Encoder=ViT-0.8M/16, Zero-shot=true2026.02 | 49.3 | |
| SLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 48.8 | |
| CLIP-MapbaseImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 48.7 |