Classification on ImageNet (Accuracy)
85.62AccuracyOTF-CBM
Evaluation Results
| Method | Links | |
|---|---|---|
| OTF-CBMbackbone=ViT, concept_embeddings=Label-Free CBM, training_strategy=independent2026.06 | 85.62 | |
| DOT-CBMbackbone=ViT, concept_embeddings=Label-Free CBM, training_strategy=independent2026.06 | 83.84 | |
| LaBobackbone=ViT, concept_embeddings=Label-Free CBM, training_strategy=independent2026.06 | 82.93 | |
| SparseCBMbackbone=ViT, concept_embeddings=Label-Free CBM, training_strategy=independent2026.06 | 82.85 | |
| CoopCBMbackbone=ViT, concept_embeddings=Label-Free CBM, training_strategy=independent2026.06 | 82.73 | |
| CEMbackbone=ViT, concept_embeddings=Label-Free CBM, training_strategy=independent2026.06 | 81.29 | |
| Vanilla-CBMbackbone=ViT, concept_embeddings=Label-Free CBM, training_strategy=independent2026.06 | 79.17 | |
| PEcoreData size=5B, Zero-shot=true2026.03 | 78.4 | |
| SigLIP2Data size=10B, Zero-shot=true2026.03 | 78.2 | |
| OpenCLIP ViT-H/14Zero-shot=true, Backbone=ViT-H/14, Confidence Interval=95% CI, Runs=52025.10 | 76.91 | |
| SigLIPData size=10B, Zero-shot=true2026.03 | 76.2 | |
| LlipData size=2.5B, Zero-shot=true2026.03 | 75.3 | |
| MetaCLIPData size=2.5B, Zero-shot=true2026.03 | 72.1 | |
| OpenCLIPData size=2B, Zero-shot=true2026.03 | 70.2 | |
| SD, trunc. inverse-SNRZero-shot=true, Backbone=Stable Diffusion, Weighting=truncated inverse-SNR, Confidence Interval=95% CI, Runs=52025.10 | 65.28 | |
| SD, inverse-SNRZero-shot=true, Backbone=Stable Diffusion, Weighting=inverse-SNR, Confidence Interval=95% CI, Runs=52025.10 | 64.17 | |
| CLIP RN-50Zero-shot=true, Backbone=RN-50, Confidence Interval=95% CI, Runs=52025.10 | 58.41 | |
| DreamLIPData size=30M, Zero-shot=true2026.03 | 58.1 | |
| SD, uniform (ours)Zero-shot=true, Backbone=Stable Diffusion, Weighting=uniform, Confidence Interval=95% CI, Runs=52025.10 | 57.91 | |
| COSMOSData size=30M, Zero-shot=true2026.03 | 57.6 | |
| GoldiCLIPData size=30M, Zero-shot=true2026.03 | 57.4 | |
| FLAIRData size=30M, Zero-shot=true2026.03 | 56.6 | |
| SD, uniform (Li et al.)Zero-shot=true, Backbone=Stable Diffusion, Weighting=uniform, Confidence Interval=95% CI, Runs=52025.10 | 54.96 | |
| SigLIPData size=30M, Zero-shot=true2026.03 | 51 | |
| CLIPData size=30M, Zero-shot=true2026.03 | 50 | |
| ARGENTModel Size=Large2026.03 | 45.6 | |
| ARGENTModel Size=Base2026.03 | 44 | |
| HyCoCLIPModel Size=Large2026.03 | 43.9 | |
| HyCoCLIPModel Size=Base2026.03 | 43.1 | |
| CLIPModel Size=Large2026.03 | 39.9 | |
| MERUModel Size=Large2026.03 | 39.6 | |
| ARGENTModel Size=Small2026.03 | 38.8 | |
| HyCoCLIPModel Size=Small2026.03 | 37.3 | |
| CLIPModel Size=Base2026.03 | 36.9 | |
| MERUModel Size=Base2026.03 | 36.2 | |
| CLIPModel Size=Small2026.03 | 32.8 | |
| MERUModel Size=Small2026.03 | 32.6 | |
| Final Self-Filtered 30% Data MixBackbone=ViT-B/32, Data=Final data mix from last round of Self-Filtering, Evaluation Protocol=Zero-shot2026.06 | 9.9 | |
| CLIP with OAI CLIP Filtered data + AllBackbone=ViT-B/32, Data=OAI Filtered + All data mix, Evaluation Protocol=Zero-shot2026.06 | 9.8 | |
| Self-Filtering 30%Backbone=ViT-B/32, Data=30% subset selected via Self-Filtering, Evaluation Protocol=Zero-shot2026.06 | 9.6 | |
| Self-Filtering 40%Backbone=ViT-B/32, Data=40% subset selected via Self-Filtering, Evaluation Protocol=Zero-shot2026.06 | 9.4 | |
| CLIP with All dataBackbone=ViT-B/32, Data=11.49M samples (Datacomp small), Evaluation Protocol=Zero-shot2026.06 | 9 | |
| CLIP with OAI CLIP Filtered dataBackbone=ViT-B/32, Data=Data selected by OpenAI’s CLIP ViT-L/14, Evaluation Protocol=Zero-shot2026.06 | 7.3 |