Image Classification on STL10 (Accuracy)
99.6AccuracyBASIC-L
Evaluation Results
| Method | Links | |
|---|---|---|
| BASIC-LBackbone=BASIC-L2021.11 | 99.6 | |
| CLIPBackbone=ViT-L/14-3362021.11 | 99.4 | |
| BASIC-MBackbone=BASIC-M2021.11 | 99.3 | |
| CLIP (reported)Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 99.3 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 99.3 | |
| DaVinciLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 99.2 | |
| X-FM_baseLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 99.2 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 99.1 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 99.1 | |
| CLIPLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 99 | |
| FLAVALinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 98.9 | |
| ITOBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 98.6 | |
| FLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 98.5 | |
| CLIPModel Type=Teacher, Img. Enc.=ViT-B/16, Param. Size=76M, zero-shot=true2023.01 | 98.2 | |
| CLIPBackbone=ViT-B/162021.11 | 98.2 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 98.2 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 98.2 | |
| ITO sub2Backbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 98.2 | |
| CLIPBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 97.5 | |
| BeamCLIPModel Type=Student, Img. Enc.=RN50, Param. Size=24M2023.01 | 97.45 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 97.1 | |
| ITOZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 97 | |
| Simple AveragingMerging Strategy=Simple Averaging, Quantization Method=Full-precision, Bit-width=Full, Backbone=CLIP-ViT-B/322026.05 | 97 | |
| CLIPBackbone=ViT-B/32, Evaluation Protocol=Zero-shot2026.03 | 96.89 | |
| BASIC-SBackbone=BASIC-S2021.11 | 96.7 | |
| CLIP+Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 96.7 | |
| UNICOMPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 96.7 | |
| Simple Averaging + GPTQMerging Strategy=Simple Averaging, Quantization Method=GPTQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 96.53 | |
| Simple Averaging + RTNMerging Strategy=Simple Averaging, Quantization Method=RTN, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 96.35 | |
| WUDI-Merging + E-PMQMerging Strategy=WUDI-Merging, Quantization Method=E-PMQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 96.3 | |
| EnsemblingBackbone=ViT-B/322026.02 | 96 | |
| Simple Averaging + AWQMerging Strategy=Simple Averaging, Quantization Method=AWQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 95.94 | |
| AGFTBackbone=ViT-B/32, Evaluation Protocol=Zero-shot, Training Strategy=Adversarially fine-tuned2026.03 | 95.72 | |
| GLADIATORBackbone=ViT-B/32, Evaluation Protocol=Zero-shot, Training Strategy=Adversarially fine-tuned2026.03 | 95.71 | |
| CLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 95.5 | |
| Simple Averaging + E-PMQMerging Strategy=Simple Averaging, Quantization Method=E-PMQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 95.25 | |
| TIES-Merging + E-PMQMerging Strategy=TIES-Merging, Quantization Method=E-PMQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 95.1 | |
| nCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 94.8 | |
| ReMixMatchLearning paradigm=Semi-supervised2021.03 | 94.8 | |
| PMG-AFTBackbone=ViT-B/32, Evaluation Protocol=Zero-shot, Training Strategy=Adversarially fine-tuned2026.03 | 94.73 | |
| CLIPBackbone=ResNet-502021.11 | 94.3 | |
| SLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 93.8 | |
| TGA-ZSRBackbone=ViT-B/32, Evaluation Protocol=Zero-shot, Training Strategy=Adversarially fine-tuned2026.03 | 93.52 | |
| Task Arithmetic + E-PMQMerging Strategy=Task Arithmetic, Quantization Method=E-PMQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 93.44 | |
| WUDI-MergingMerging Strategy=WUDI-Merging, Quantization Method=Full-precision, Bit-width=Full, Backbone=CLIP-ViT-B/322026.05 | 93.4 | |
| KDModel Type=Student, Img. Enc.=RN50, Param. Size=24M2023.01 | 93.28 | |
| TeCoABackbone=ViT-B/32, Evaluation Protocol=Zero-shot, Training Strategy=Adversarially fine-tuned2026.03 | 93.23 | |
| SPICELearning paradigm=Unsupervised2021.03 | 92.9 | |
| xCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 92.8 | |
| WUDI-Merging + GPTQMerging Strategy=WUDI-Merging, Quantization Method=GPTQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 92.75 | |
| UDALearning paradigm=Semi-supervised2021.03 | 92.3 | |
| WUDI-Merging + RTNMerging Strategy=WUDI-Merging, Quantization Method=RTN, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 92.2 | |
| WUDI-Merging + AWQMerging Strategy=WUDI-Merging, Quantization Method=AWQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 92.01 | |
| FixMatchLearning paradigm=Semi-supervised2021.03 | 92 | |
| CLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 91.3 | |
| DLMEEvaluation Protocol=linear-test2022.07 | 90.1 | |
| CyCLIPprotocol=Linear probing, backbone=ResNet-502022.05 | 90.1 | |
| TIES-Merging + GPTQMerging Strategy=TIES-Merging, Quantization Method=GPTQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 89.93 | |
| M-TIESBackbone=ViT-B/322026.02 | 89.9 | |
| TIES-MergingMerging Strategy=TIES-Merging, Quantization Method=Full-precision, Bit-width=Full, Backbone=CLIP-ViT-B/322026.05 | 89.9 | |
| MixMatchLearning paradigm=Semi-supervised2021.03 | 89.6 | |
| TIES-Merging + RTNMerging Strategy=TIES-Merging, Quantization Method=RTN, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 89.53 | |
| TIES-Merging + AWQMerging Strategy=TIES-Merging, Quantization Method=AWQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 89.35 | |
| CLIPprotocol=Linear probing, backbone=ResNet-502022.05 | 89.23 | |
| Deep Laplacian eigenmapsEvaluation protocol=linear evaluation protocol2022.10 | 88.97 | |
| BYOLEvaluation Protocol=linear-test2022.07 | 88.7 | |
| Barlow TwinsEvaluation protocol=linear evaluation protocol2022.10 | 88.65 | |
| BYOLEvaluation protocol=linear evaluation protocol2022.10 | 88.46 | |
| DLME-A1Evaluation Protocol=linear-test2022.07 | 88.1 | |
| SLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 88.1 | |
| ITO sub2Pre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 88.1 | |
| DLME-A2Evaluation Protocol=linear-test2022.07 | 87.9 | |
| DAREBackbone=ViT-B/322026.02 | 87.8 | |
| MoCo v2Evaluation protocol=linear evaluation protocol2022.10 | 87.71 | |
| TIESBackbone=ViT-B/322026.02 | 87.6 | |
| SimCLREvaluation protocol=linear evaluation protocol2022.10 | 87.52 | |
| DLME-A3Evaluation Protocol=linear-test2022.07 | 87.3 | |
| SimCLREvaluation Protocol=linear-test2022.07 | 86.9 | |
| MoCo.v2Evaluation Protocol=linear-test2022.07 | 85.6 | |
| ITOPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 85.6 | |
| InvL-DNPδ (noise level)=0.07, Backbone=ResNet, Batch size=10, FC layer size=202025.12 | 84 | |
| DNPδ (noise level)=0.03, Backbone=ResNet, Batch size=10, FC layer size=202025.12 | 83.3 | |
| FLAIRPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 83.1 | |
| NPIDEvaluation Protocol=linear-test2022.07 | 82.5 | |
| DINORANKCLIPProtocol=Linear probing2026.05 | 82.4 | |
| CyCLIPProtocol=Linear probing2026.05 | 82.3 | |
| CRDModel Type=Student, Img. Enc.=RN50, Param. Size=24M2023.01 | 81.41 | |
| InvL-GNPδ (noise level)=0.005, Backbone=ResNet, Batch size=10, FC layer size=202025.12 | 81.3 | |
| ALIPProtocol=Linear probing2026.05 | 81 | |
| GNPδ (noise level)=0.001, Backbone=ResNet, Batch size=10, FC layer size=202025.12 | 80.2 | |
| RANKCLIPProtocol=Linear probing2026.05 | 79.6 | |
| CLIPProtocol=Linear probing2026.05 | 79 | |
| Mean TeacherLearning paradigm=Semi-supervised2021.03 | 78.6 | |
| SCANLearning paradigm=Unsupervised2021.03 | 76.7 | |
| Π-ModelLearning paradigm=Semi-supervised2021.03 | 74.8 | |
| ODCEvaluation Protocol=linear-test2022.07 | 73.4 | |
| H-SCL(β)Evaluation Protocol=Linear probing, Backbone=ResNet-50, Projection head dimension=128, Batch size=512, Epochs=2002022.08 | 72.52 | |
| Pseudo-LabelingLearning paradigm=Semi-supervised2021.03 | 72 | |
| H-SCL(τ)Evaluation Protocol=Linear probing, Backbone=ResNet-50, Projection head dimension=128, Batch size=512, Epochs=2002022.08 | 71.02 | |
| Task ArithmeticMerging Strategy=Task Arithmetic, Quantization Method=Full-precision, Bit-width=Full, Backbone=CLIP-ViT-B/322026.05 | 71 |