Image Classification on ImageNet and Distribution Shifts
75.8ImageNet-V2 AccuracyGreedy Model Soups + CAR-FT
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Greedy Model Soups + CAR-FTEnsemble Strategy=Greedy Weight-Space Ensemble, Backbone=ViT-B/162022.11 | 75.8 | 85 | 74.4 | 54.6 | 31.6 | 48.9 | 57.1 | 61.7 | |
| Greedy Model SoupsEnsemble Strategy=Greedy Weight-Space Ensemble, Backbone=ViT-B/162022.11 | 75.1 | 84.8 | 74.1 | 53.8 | 30.3 | 48.1 | 56.3 | 61 | |
| Uniform Model Soups + CAR-FTEnsemble Strategy=Uniform Weight-Space Ensemble, Backbone=ViT-B/162022.11 | 75.1 | 83.9 | 77.3 | 55.5 | 32 | 51.1 | 58.2 | 62.5 | |
| Uniform Model SoupsEnsemble Strategy=Uniform Weight-Space Ensemble, Backbone=ViT-B/162022.11 | 74.7 | 83.4 | 76.8 | 54.6 | 31.5 | 50 | 57.5 | 61.8 | |
| CAR-FTEvaluation Protocol=Fine-tuning Only, Backbone=ViT-B/162022.11 | 74 | 83.3 | 75.4 | 53 | 32.6 | 49.5 | 56.9 | 61.3 | |
| WiSE-FT + CAR-FTEnsemble Strategy=Weight-Space Ensemble, Backbone=ViT-B/162022.11 | 73.3 | 82.1 | 79.2 | 54.5 | 33.8 | 53.6 | 58.9 | 62.8 | |
| E2E-FT + Weight-space ensembleBackbone=CLIP ViT-B/162024.11 | 73.1 | — | 75.1 | 51.6 | 55.7 | 47.6 | 60.6 | — | |
| E2E-FT + Weight-space ensembleBackbone=ViT-B/162024.11 | 73.1 | — | 75.1 | 51.6 | 55.7 | 47.6 | 60.6 | — | |
| LP-FT + Weight-space ensembleBackbone=CLIP ViT-B/162024.11 | 73 | — | 74.2 | 51.5 | 56.6 | 50.6 | 61.2 | — | |
| LP-FT + Weight-space ensembleBackbone=ViT-B/162024.11 | 73 | — | 74.2 | 51.5 | 56.6 | 50.6 | 61.2 | — | |
| WiSE-FT (opt. a)Ensemble Strategy=Weight-Space Ensemble, Backbone=ViT-B/162022.11 | 72.7 | 81.7 | 78.8 | 53.2 | 33.4 | 52.2 | 58.1 | 62 | |
| LP-FT + Output-space ensembleBackbone=CLIP ViT-B/162024.11 | 72.3 | — | 74.9 | 50.9 | 55.7 | 50.9 | 60.9 | — | |
| LP-FT + VRFBackbone=CLIP ViT-B/162024.11 | 72.3 | — | 78.8 | 52.9 | 57.2 | 51.2 | 62.4 | — | |
| LP-FT + Output-space ensembleBackbone=ViT-B/162024.11 | 72.3 | — | 74.9 | 50.9 | 55.7 | 50.9 | 60.9 | — | |
| LP-FT + VRFBackbone=ViT-B/162024.11 | 72.3 | — | 78.8 | 52.9 | 57.2 | 51.2 | 62.4 | — | |
| E2E-FT + VRFBackbone=CLIP ViT-B/162024.11 | 72.1 | — | 78.7 | 52.9 | 56.4 | 48.4 | 61.8 | — | |
| E2E-FT + VRFBackbone=ViT-B/162024.11 | 72.1 | — | 78.7 | 52.9 | 56.4 | 48.4 | 61.8 | — | |
| E2E-FT + Output-space ensembleBackbone=CLIP ViT-B/162024.11 | 72 | — | 76.7 | 50.6 | 54.9 | 46.8 | 60.2 | — | |
| E2E-FT + Output-space ensembleBackbone=ViT-B/162024.11 | 72 | — | 76.7 | 50.6 | 54.9 | 46.8 | 60.2 | — | |
| LP-FTEvaluation Protocol=Fine-tuning Only, Backbone=ViT-B/162022.11 | 71.6 | 81.7 | 72.9 | 48.4 | 28.2 | 49.1 | 54 | 58.7 | |
| FTEvaluation Protocol=Fine-tuning Only, Backbone=ViT-B/162022.11 | 70.9 | 81 | 54.7 | 42.1 | 26.6 | 31.3 | 45.1 | 51.1 | |
| TP-FTEvaluation Protocol=Fine-tuning Only, Backbone=ViT-B/162022.11 | 70.7 | 81.2 | 65 | 44.9 | 27.4 | 35.3 | 48.7 | 54.1 | |
| LP-FTBackbone=CLIP ViT-B/162024.11 | 70.7 | — | 66.4 | 46.7 | 52.4 | 41.4 | 55.5 | — | |
| LP-FTBackbone=ViT-B/162024.11 | 70.7 | — | 66.4 | 46.7 | 52.4 | 41.4 | 55.5 | — | |
| E2E-FTBackbone=CLIP ViT-B/162024.11 | 70.6 | — | 65.6 | 45.1 | 50.5 | 36.6 | 53.7 | — | |
| E2E-FTBackbone=ViT-B/162024.11 | 70.6 | — | 65.6 | 45.1 | 50.5 | 36.6 | 53.7 | — | |
| Linear classifierBackbone=CLIP ViT-B/162024.11 | 69.1 | — | 66.7 | 44.8 | 51.1 | 44.3 | 55.2 | — | |
| Linear classifierBackbone=ViT-B/162024.11 | 69.1 | — | 66.7 | 44.8 | 51.1 | 44.3 | 55.2 | — | |
| E2E-FT + Weight-space ensembleBackbone=CLIP ViT-B/322024.11 | 67.2 | — | 66.4 | 45.1 | 45.1 | 28.8 | 50.5 | — | |
| MERGETUNEBackbone=ViT-B/32, Evaluation Protocol=Robust fine-tuning2026.01 | 67.02 | — | 70.67 | 46.83 | 47.01 | 31.8 | 52.67 | — | |
| LP-FT + Weight-space ensembleBackbone=CLIP ViT-B/322024.11 | 67 | — | 65.8 | 44.8 | 46.1 | 31.2 | 51 | — | |
| E2E-FT + Weight ens.Backbone=ViT-B/32, Evaluation Protocol=Robust fine-tuning2026.01 | 66.86 | — | 66.68 | 45.67 | 44.72 | 28.21 | 50.43 | — | |
| E2E-FT + VRFBackbone=CLIP ViT-B/322024.11 | 66.7 | — | 70.9 | 47 | 46.3 | 29.2 | 52 | — | |
| LP-FT + VRFBackbone=CLIP ViT-B/322024.11 | 66.7 | — | 70 | 46.1 | 46.3 | 31 | 51.8 | — | |
| E2E-FT + VRFBackbone=ViT-B/32, Evaluation Protocol=Robust fine-tuning2026.01 | 66.7 | — | 70.9 | 47 | 46.3 | 29.2 | 52.02 | — | |
| MERGETUNE + Weight ens.Backbone=ViT-B/32, Evaluation Protocol=Robust fine-tuning2026.01 | 66.59 | — | 71.09 | 46.87 | 46.99 | 32.4 | 52.79 | — | |
| E2E-FT + DAREBackbone=ViT-B/32, Evaluation Protocol=Robust fine-tuning2026.01 | 66.32 | — | 69.75 | 46.49 | 45.13 | 28.55 | 51.25 | — | |
| LP-FT + Output-space ensembleBackbone=CLIP ViT-B/322024.11 | 66.3 | — | 66.2 | 44 | 45.5 | 29.5 | 50.3 | — | |
| E2E-FT + Output-space ensembleBackbone=CLIP ViT-B/322024.11 | 66 | — | 68.4 | 44.2 | 44.4 | 27.1 | 50 | — | |
| E2E-FT + TIESBackbone=ViT-B/32, Evaluation Protocol=Robust fine-tuning2026.01 | 65.88 | — | 69.21 | 46.2 | 44.56 | 28.12 | 50.79 | — | |
| LP-FTBackbone=CLIP ViT-B/322024.11 | 64.8 | — | 69.9 | 39.9 | 42.6 | 25.7 | 48.6 | — | |
| E2E-FTBackbone=ViT-B/32, Evaluation Protocol=Robust fine-tuning2026.01 | 64.21 | — | 57.38 | 39.62 | 39.63 | 20.35 | 44.24 | — | |
| E2E-FTBackbone=CLIP ViT-B/322024.11 | 64.2 | — | 57.1 | 38.7 | 40.1 | 21 | 44.2 | — | |
| Linear classifierBackbone=CLIP ViT-B/322024.11 | 63.4 | — | 58.7 | 38.8 | 41.5 | 26.1 | 45.7 | — | |
| CLIP Zero-shotEvaluation Protocol=Zero-shot, Backbone=ViT-B/162022.11 | 61.9 | 68.3 | 77.6 | 48.3 | 29.8 | 50.1 | 53.5 | 56 | |
| Zero-shotBackbone=CLIP ViT-B/162024.11 | 61.9 | — | 77.6 | 48.3 | 54.2 | 50.1 | 58.4 | — | |
| Zero-shotBackbone=ViT-B/162024.11 | 61.9 | — | 77.6 | 48.3 | 54.2 | 50.1 | 58.4 | — | |
| Zero-shot (CLIP)Backbone=ViT-B/32, Evaluation Protocol=Zero-shot2026.01 | 55.94 | — | 69.26 | 42.33 | 43.46 | 31.45 | 48.49 | — | |
| Zero-shotBackbone=CLIP ViT-B/322024.11 | 55.9 | — | 69.3 | 42.3 | 43.5 | 31.5 | 48.5 | — | |
| DevilType=D3, Dataset Size=20M2024.05 | — | — | — | — | — | — | — | 26.7 | |
| DFNType=D2, Dataset Size=16M2024.05 | — | — | — | — | — | — | — | 30.1 | |
| DFN ∪ HYPEType=D3, Dataset Size=20M2024.05 | — | — | — | — | — | — | — | 30.8 | |
| DFN ∪ HYPE ∪ Ours (10%)*Type=D3, Dataset Size=22M2024.05 | — | — | — | — | — | — | — | 31.4 | |
| DFN ∪ Ours (20%)*Type=D3, Dataset Size=23M2024.05 | — | — | — | — | — | — | — | 30.9 | |
| HYPEType=D3, Dataset Size=10M2024.05 | — | — | — | — | — | — | — | 25.8 | |
| MLMType=D3, Dataset Size=38M2024.05 | — | — | — | — | — | — | — | 25.6 | |
| Ours (20%)Type=D1, Dataset Size=22M2024.05 | — | — | — | — | — | — | — | 27.4 | |
| T-MARSType=D3, Dataset Size=22M2024.05 | — | — | — | — | — | — | — | 26.3 |