Image Classification on Places-365 (val)
61.5AccuracyLoRA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LoRABackbone=ViT-g (1B), Update Param (M)=18, Memory Usage Train (GB)=4.86, Memory Usage Inference (GB)=4.08, Speed Train (img/sec)=27.5, Speed Inference (img/sec)=64.2, GFLOPs=272.22024.02 | 61.5 | — | — | — | |
| LoSABackbone=ViT-g (1B), Update Param (M)=4.8, Memory Usage Train (GB)=4.19, Memory Usage Inference (GB)=4.07, Speed Train (img/sec)=64.7, Speed Inference (img/sec)=73.6, GFLOPs=269.42024.02 | 61.3 | — | — | — | |
| Full fine-tuningBackbone=ViT-g (1B), Update Param (M)=1000, Memory Usage Train (GB)=8.71, Memory Usage Inference (GB)=4.01, Speed Train (img/sec)=17.6, Speed Inference (img/sec)=77.3, GFLOPs=267.42024.02 | 61.1 | — | — | — | |
| Finetune only attentionBackbone=ViT-g (1B), Update Param (M)=320, Memory Usage Train (GB)=5.96, Memory Usage Inference (GB)=4.01, Speed Train (img/sec)=25.7, Speed Inference (img/sec)=77.4, GFLOPs=267.42024.02 | 60.9 | — | — | — | |
| Finetune only mlpBackbone=ViT-g (1B), Update Param (M)=700, Memory Usage Train (GB)=7.39, Memory Usage Inference (GB)=4.01, Speed Train (img/sec)=23.1, Speed Inference (img/sec)=77.7, GFLOPs=267.42024.02 | 60.8 | — | — | — | |
| MAEStatus=Fine-tuned SOTA2022.06 | 60.3 | — | — | — | |
| OMNIVORE (Swin-L)Backbone=Swin-L, Resolution=384x3842022.01 | 59.9 | — | — | — | |
| Finetune last 2 layersBackbone=ViT-g (1B), Update Param (M)=75, Memory Usage Train (GB)=4.41, Memory Usage Inference (GB)=4.01, Speed Train (img/sec)=64.4, Speed Inference (img/sec)=77.6, GFLOPs=267.42024.02 | 59.7 | — | — | — | |
| OMNIVORE (Swin-B)Backbone=Swin-B, Resolution=384x3842022.01 | 59.6 | — | — | — | |
| LSTBackbone=ViT-g (1B), Update Param (M)=27, Memory Usage Train (GB)=4.77, Memory Usage Inference (GB)=4.11, Speed Train (img/sec)=42.5, Speed Inference (img/sec)=66.4, GFLOPs=274.92024.02 | 59.5 | — | — | — | |
| Finetune last layerBackbone=ViT-g (1B), Update Param (M)=50, Memory Usage Train (GB)=4.3, Memory Usage Inference (GB)=4.01, Speed Train (img/sec)=69.4, Speed Inference (img/sec)=77.5, GFLOPs=267.42024.02 | 59.5 | — | — | — | |
| OMNIVORE (Swin-L)Backbone=Swin-L, Resolution=224x2242022.01 | 59.4 | — | — | — | |
| OMNIVORE (Swin-B)Backbone=Swin-B, Resolution=224x2242022.01 | 59.3 | — | — | — | |
| Prompt TuningBackbone=ViT-g (1B), Update Param (M)=0.6, Memory Usage Train (GB)=6, Memory Usage Inference (GB)=4.04, Speed Train (img/sec)=11, Speed Inference (img/sec)=27.9, GFLOPs=571.82024.02 | 59.2 | — | — | — | |
| ViT-L/16Backbone=ViT-L/16, Resolution=384x3842022.01 | 59 | — | — | — | |
| EfficientNet B7Backbone=EfficientNet B72022.01 | 58.7 | — | — | — | |
| EfficientNet B8Backbone=EfficientNet B82022.01 | 58.6 | — | — | — | |
| BitfitBackbone=ViT-g (1B), Update Param (M)=0.7, Memory Usage Train (GB)=4.69, Memory Usage Inference (GB)=4.01, Speed Train (img/sec)=34.2, Speed Inference (img/sec)=77.5, GFLOPs=267.42024.02 | 58.6 | — | — | — | |
| EfficientNet B6Backbone=EfficientNet B62022.01 | 58.5 | — | — | — | |
| ViT-B/16Backbone=ViT-B/16, Resolution=384x3842022.01 | 58.2 | — | — | — | |
| Linear probingBackbone=ViT-g (1B), Update Param (M)=0, Memory Usage Train (GB)=4.09, Memory Usage Inference (GB)=4.01, Speed Train (img/sec)=75.9, Speed Inference (img/sec)=77.6, GFLOPs=267.42024.02 | 57.8 | — | — | — | |
| ViT-B w/ AGLUBackbone=ViT-B, AGLU=true, Crop Size=2242024.07 | 57.1 | — | — | — | |
| ViT-BBackbone=ViT-B, Crop Size=2242024.07 | 56.9 | — | — | — | |
| WaveMixPre-train=None, Parameters=28 M2022.05 | 56.45 | — | — | — | |
| WaveMixAugmentation=TrivialAugment2022.05 | 56.45 | — | — | — | |
| Previous SOTA [2]Pre-train=None, Parameters=31 M2022.05 | 56.32 | — | — | — | |
| Previous SOTA [2]2022.05 | 56.32 | — | — | — | |
| Full fine-tuningFine-tuning regime=Full2022.03 | 55.9 | — | — | — | |
| Linear ProbeBackbone=CLIP ViT-B/162025.10 | 55.1 | — | — | — | |
| DN-CBMBackbone=CLIP ViT-B/162025.10 | 55.1 | — | — | — | |
| SE-ResNet50 w/ APA* + AGLUBackbone=ResNet-50, SE=true, APA=true, AGLU=true, Crop Size=2242024.07 | 54.7 | — | — | — | |
| SE-ResNet50Backbone=ResNet-50, SE=true, Crop Size=2242024.07 | 54.3 | — | — | — | |
| Learnable Memory TokensMemory cells=202022.03 | 54.1 | — | — | — | |
| Learnable Memory TokensMemory cells=102022.03 | 53.9 | — | — | — | |
| Learnable Memory TokensMemory cells=52022.03 | 53.8 | — | — | — | |
| Learnable Memory TokensMemory cells=12022.03 | 53.3 | — | — | — | |
| UNIFIED-IO XLModel Size=XL2022.06 | 53.2 | — | — | — | |
| CDMBackbone=CLIP ViT-B/162025.10 | 52.6 | — | — | — | |
| Head + Class token fine-tuningFine-tuning regime=Head + Class2022.03 | 52.4 | — | — | — | |
| SEG-MIL-CBMBackbone=CLIP ViT-B/162025.10 | 51.24 | — | — | — | |
| Head-only fine-tuningFine-tuning regime=Head Only2022.03 | 50.9 | — | — | — | |
| DCBM-MASKRCNNBackbone=CLIP ViT-B/162025.10 | 50.9 | — | — | — | |
| DCBM-GDINOBackbone=CLIP ViT-B/162025.10 | 50.7 | — | — | — | |
| DCBM-SAM2Backbone=CLIP ViT-B/162025.10 | 50.6 | — | — | — | |
| UNIFIED-IO LARGEModel Size=LARGE2022.06 | 50.5 | — | — | — | |
| SALF-CBMBackbone=CLIP ViT-B/162025.10 | 49.4 | — | — | — | |
| Label-Free-CBMBackbone=CLIP ViT-B/162025.10 | 48.2 | — | — | — | |
| UNIFIED-IO BASEModel Size=BASE2022.06 | 43.2 | — | — | — | |
| Zero-Shot CLIPMode=Zero-shot2024.04 | 41.12 | — | — | — | |
| DescriptionCLS2024.04 | 40.55 | — | — | — | |
| DCLIPBackbone=CLIP ViT-B/162025.10 | 40.3 | — | — | — | |
| Zero ShotBackbone=CLIP ViT-B/162025.10 | 39.5 | — | — | — | |
| Concept Matrix Search2024.04 | 39.43 | — | — | — | |
| UNIFIED-IO SMALLModel Size=SMALL2022.06 | 38.2 | — | — | — | |
| Align# params (M)=247, zero-shot=true2023.06 | — | 44 | — | — | |
| CLIP-B/32# params (M)=151, zero-shot=true2023.06 | — | 40.6 | — | — | |
| CLIP-B/32 + RECO# params (M)=154, zero-shot=true2023.06 | — | 42.2 | — | — | |
| CLIP-L/14# params (M)=428, zero-shot=true2023.06 | — | 42 | — | — | |
| CLIP-L/14 + RECO# params (M)=435, zero-shot=true2023.06 | — | 43.6 | — | — | |
| CLIP-R-50# params (M)=102, zero-shot=true2023.06 | — | 53.1 | — | — | |
| CLIP-R-50 + RECO# params (M)=114, zero-shot=true2023.06 | — | 54 | — | — | |
| DP-SGDPre-Training Data=JFT-300M, Architecture=NFNets, delta=5 · 10^-72022.04 | — | — | — | 55.1 | |
| GRF++2025.10 | — | 56.03 | — | — | |
| LiT-L16L# params (M)=638, zero-shot=true2023.06 | — | 45.2 | — | — | |
| LiT-L16L + RECO# params (M)=652, zero-shot=true2023.06 | — | 45.4 | — | — | |
| NF-ResNet-50 (All layers, Non-private)epsilon=Non-private, Fine-tuning Method=All layers, Backbone=NF-ResNet-50, Pre-training=JFT-300M2022.04 | — | 57 | 87.1 | — | |
| NF-ResNet-50 (All layers)epsilon=8, Fine-tuning Method=All layers, Backbone=NF-ResNet-50, Pre-training=JFT-300M2022.04 | — | 55.1 | 84.6 | — | |
| NF-ResNet-50 (Classifier layer, Non-private)epsilon=Non-private, Fine-tuning Method=Classifier layer, Backbone=NF-ResNet-50, Pre-training=JFT-300M2022.04 | — | 54.5 | 85.3 | — | |
| NF-ResNet-50 (Classifier layer)epsilon=8, Fine-tuning Method=Classifier layer, Backbone=NF-ResNet-50, Pre-training=JFT-300M2022.04 | — | 54.4 | 84.4 | — | |
| ViTVariant=standard2025.10 | — | 55.78 | — | — |