Image Classification on Flowers-102 (val)
99.76Top-1 AccCCT-14/7x2
Evaluation Results
| Method | Links | |
|---|---|---|
| CCT-14/7x2Resolution=384, Pretraining=ImageNet-1k, # Params=22.17 M, MACS=18.63 G2021.04 | 99.76 | |
| ViT-L/16Resolution=384, Pretraining=JFT-300M, # Params=304.71 M, MACS=191.30 G2021.04 | 99.74 | |
| ViT-H/14Resolution=384, Pretraining=JFT-300M, # Params=661.00 M, MACS=504.00 G2021.04 | 99.68 | |
| AdamModel=ViT-large, Learning Rate=lr << 12026.03 | 99.37 | |
| LoRAModel=ViT Large, Params (%)=0.532025.10 | 99.32 | |
| ViT-B + DenoiseRepParam=87M, Configuration=+DenoiseRep2024.06 | 99.3 | |
| DoRAModel=ViT Large, Params (%)=0.552025.10 | 99.28 | |
| LoRAModel=ViT Base, Params (%)=0.722025.10 | 99.22 | |
| StelLAModel=ViT Base, Params (%)=0.732025.10 | 99.22 | |
| PiSSAModel=ViT Large, Params (%)=0.532025.10 | 99.2 | |
| DoRAModel=ViT Base, Params (%)=0.752025.10 | 99.19 | |
| StelLAModel=ViT Large, Params (%)=0.542025.10 | 99.19 | |
| ViT-BParam=87M, Configuration=Baseline2024.06 | 99.12 | |
| SGDModel=ViT-large, Learning Rate=lr > 02026.03 | 98.94 | |
| PiSSAModel=ViT Base, Params (%)=0.722025.10 | 98.88 | |
| DeiT-BResolution=384, Pretraining=ImageNet-1k, # Params=86.25 M, MACS=55.68 G2021.04 | 98.8 | |
| CCT-14/7x2Resolution=224, Pretraining=None, # Params=22.17 M, MACS=18.63 G2021.04 | 97.19 | |
| Reference Masking RegularizationBackbone=ViTb16, Pre-trained=ImageNet-1K, Adaptation Protocol=Linear Probing2024.06 | 95.7 | |
| StandardBackbone=ViTb16, Pre-trained=ImageNet-1K, Adaptation Protocol=Linear Probing2024.06 | 94.68 | |
| OTTEREvaluation Protocol=Linear Probing, Label Distribution Estimation=BBSE+OT2024.04 | 90.2 | |
| Linear Probing baselineEvaluation Protocol=Linear Probing, Label Distribution Estimation=None2024.04 | 89 | |
| BBSE+PMEvaluation Protocol=Linear Probing, Label Distribution Estimation=BBSE+PM2024.04 | 87.8 | |
| AdamModel=ResNet-18, Learning Rate=lr << 12026.03 | 80.5 | |
| DIFFUSEMIXBackbone=ResNet-18, Images per class=102024.04 | 77.14 | |
| DIFFUSEMIXBackbone=ResNet-18, Data Regime=10 images per class2024.04 | 77.14 | |
| FLAIRPre-training Dataset=CC3M-recap, Backbone=ViT-B/16, Evaluation Protocol=Linear Probing2026.03 | 76.57 | |
| GuidedMixupBackbone=ResNet-18, Images per class=102024.04 | 74.74 | |
| GuidedMixupBackbone=ResNet-18, Data Regime=10 images per class2024.04 | 74.74 | |
| ITO_sub3Pre-training Dataset=CC3M-recap, Backbone=ViT-B/16, Evaluation Protocol=Linear Probing2026.03 | 74.3 | |
| ITO_sub2Pre-training Dataset=CC3M-recap, Backbone=ViT-B/16, Evaluation Protocol=Linear Probing2026.03 | 73.64 | |
| Guided-SRBackbone=ResNet-18, Images per class=102024.04 | 72.84 | |
| PuzzleMixBackbone=ResNet-18, Images per class=102024.04 | 71.56 | |
| PuzzleMixBackbone=ResNet-18, Data Regime=10 images per class2024.04 | 71.56 | |
| MixupBackbone=ResNet-18, Images per class=102024.04 | 70.55 | |
| Co-MixupBackbone=ResNet-18, Images per class=102024.04 | 68.17 | |
| Co-MixupBackbone=ResNet-18, Data Regime=10 images per class2024.04 | 68.17 | |
| SnapMixBackbone=ResNet-18, Images per class=102024.04 | 65.71 | |
| SnapMixBackbone=ResNet-18, Data Regime=10 images per class2024.04 | 65.71 | |
| VanillaBackbone=ResNet-18, Images per class=102024.04 | 64.48 | |
| VanillaBackbone=ResNet-18, Data Regime=10 images per class2024.04 | 64.48 | |
| Zero-Shot baselineEvaluation Protocol=Zero-Shot, Label Distribution Estimation=None2024.04 | 64 | |
| Saliency MixBackbone=ResNet-18, Images per class=102024.04 | 63.23 | |
| CutMixBackbone=ResNet-18, Images per class=102024.04 | 62.68 | |
| SGDModel=ResNet-18, Learning Rate=lr > 02026.03 | 62.13 | |
| OTTEREvaluation Protocol=Zero-Shot, Label Distribution Estimation=BBSE+OT2024.04 | 60.8 | |
| BBSE+PMEvaluation Protocol=Zero-Shot, Label Distribution Estimation=BBSE+PM2024.04 | 40.3 | |
| SGDModel=ResNet-18, Learning Rate=lr << 12026.03 | 1.22 | |
| SGDModel=ViT-large, Learning Rate=lr << 12026.03 | 1.03 |