Concept Decomposition on ImageNet 500 random classes (test)
75Zero-Shot AccuracyCLIP
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| CLIPModality=Baseline2026.03 | 75 | — | — | — | 85 | — | — | — | — | — | |
| SCoCCAModality=Dual-Modality2026.03 | 74 | 0.87 | 0.95 | 0.76 | 85 | 0.93 | 30 | 0.38 | 99 | 4 | |
| VarimaxModality=Single-Modality2026.03 | 65 | 0.81 | 0.75 | 0.67 | 75 | 1 | 33 | 0.38 | 90 | 15 | |
| CLIPModality=Baseline, Backbone=CLIP ViT-B/322026.03 | 63 | — | — | — | 82 | — | — | — | — | — | |
| TCAVModality=Single-Modality2026.03 | 62 | 0.93 | 0.1 | 0.67 | 59 | 0.85 | 21 | 0.28 | 50 | 28 | |
| SCoCCAModality=Dual-Modality, Backbone=CLIP ViT-B/32, k=5002026.03 | 60 | 0.77 | 0.72 | 0.7 | 81 | 0.92 | 38 | 0.58 | 100 | 0 | |
| K-MeansModality=Single-Modality2026.03 | 53 | 0.47 | -0.09 | 0.74 | 70 | 0.86 | 100 | 1 | 84 | 29 | |
| VarimaxModality=Single-Modality, Backbone=CLIP ViT-B/32, k=5002026.03 | 52 | 0.73 | 0.61 | 0.57 | 74 | 1 | 51 | 0.41 | 100 | 2 | |
| SpLiCEModality=Dual-Modality2026.03 | 48 | 0.2 | 0.36 | 0.7 | 61 | 0.88 | 89 | 0.88 | 58 | 35 | |
| TCAVModality=Single-Modality, Backbone=CLIP ViT-B/32, k=5002026.03 | 48 | 0.79 | 0.02 | 0.58 | 71 | 0.81 | 44 | 0.39 | 64 | 11 | |
| K-MeansModality=Single-Modality, Backbone=CLIP ViT-B/32, k=5002026.03 | 40 | 0.37 | -0.39 | 0.68 | 68 | 0.83 | 100 | 1 | 92 | 27 | |
| SpLiCEModality=Dual-Modality, Backbone=CLIP ViT-B/32, k=5002026.03 | 37 | 0.12 | 0.11 | 0.63 | 58 | 0.92 | 79 | 0.9 | 69 | 22 | |
| NMFModality=Single-Modality2026.03 | 12 | 0.01 | 0.02 | 0.63 | 29 | 0.23 | 8 | 0.13 | 74 | 43 | |
| NMFModality=Single-Modality, Backbone=CLIP ViT-B/32, k=5002026.03 | 10 | 0 | -0.19 | 0.49 | 25 | 0.23 | 7 | 0.14 | 84 | 40 |