Long-tailed Image Classification on Places-LT (test)
52.4AccuracyCategory Extrapolation
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Category ExtrapolationBackbone=ViT-B, Pre-training Paradigm=Fine-tuning pre-trained model (CLIP)2024.10 | 52.4 | — | — | — | 51.6 | 53 | 52.3 | — | — | |
| LIFT†Backbone=ViT-B, Pre-training Paradigm=Fine-tuning pre-trained model (CLIP)2024.10 | 51.8 | — | — | — | 51.5 | 52.4 | 51.1 | — | — | |
| LIFTBackbone=ViT-B, Pre-training Paradigm=Fine-tuning pre-trained model (CLIP)2024.10 | 51.5 | — | — | — | 51.3 | 52.2 | 50.5 | — | — | |
| Category ExtrapolationBackbone=ViT-B, Pre-training Paradigm=Fine-tuning pre-trained model (DINOv2)2024.10 | 50.8 | — | — | — | 49.4 | 52.4 | 49.2 | — | — | |
| LPTBackbone=ViT-B, Tuned Params=1.01M, Total Params=87.58M2022.10 | 50.1 | — | — | — | 49.3 | 52.3 | 46.9 | — | — | |
| VL-LTRBackbone=ViT-B, Tuned Params=149.62M, Total Params=149.62M, Extra Data (Inference)=Wiki Text2022.10 | 50.1 | — | — | — | 54.2 | 48.5 | 42 | — | — | |
| VL-LTRBackbone=ViT-B/16, Model Architecture=MHSA-based, Data Modality=Supplementary with linguistic data2024.10 | 50.1 | — | — | — | — | 48.5 | — | 54.2 | 42 | |
| GNM-PTBackbone=ViT-B/16, Model Architecture=MHSA-based, Data Modality=Visual-only, Training Strategy=Standard (with DRW)2024.10 | 50.1 | — | — | — | — | 53.3 | — | 46.6 | 49.4 | |
| GNM-PTBackbone=ViT-B/16, Model Architecture=MHSA-based, Data Modality=Visual-only, Training Strategy=Without DRW2024.10 | 50 | — | — | — | — | 52.1 | — | 48.6 | 47.9 | |
| Bal-CE†Backbone=ViT-B, Pre-training Paradigm=Fine-tuning pre-trained model (DINOv2)2024.10 | 49.9 | — | — | — | 49.3 | 51.6 | 47.3 | — | — | |
| LPTBackbone=ViT-B/16, Model Architecture=MHSA-based, Data Modality=Visual-only, Evaluation Protocol=reproduced with recommended settings2024.10 | 49.7 | — | — | — | — | 52.1 | — | 47.6 | 48.4 | |
| BALLADBackbone=ViT-B, Tuned Params=149.62M, Total Params=149.62M2022.10 | 49.5 | — | — | — | 49.3 | 50.2 | 48.4 | — | — | |
| Bal-CEBackbone=ViT-B, Pre-training Paradigm=Fine-tuning pre-trained model (DINOv2)2024.10 | 48.5 | — | — | — | 49.2 | 51.3 | 46.1 | — | — | |
| RACBackbone=ViT-B, Tuned Params=86.57M, Total Params=236.19M, Extra Data (Inference)=IN21k Feat2022.10 | 47.2 | — | — | — | 48.7 | 48.3 | 41.8 | — | — | |
| RACBackbone=ViT-B/16, Model Architecture=MHSA-based, Data Modality=Supplementary with linguistic data2024.10 | 47.2 | — | — | — | — | 48.3 | — | 48.7 | 41.8 | |
| DecoderBackbone=ViT-B/16, Model Architecture=MHSA-based, Data Modality=Visual-only2024.10 | 46.8 | — | — | — | — | — | — | — | — | |
| Category ExtrapolationBackbone=ViT-B, Pre-training Paradigm=Training from scratch2024.10 | 43.8 | — | — | — | 43.7 | 44.8 | 41.6 | — | — | |
| LiVT†Backbone=ViT-B, Pre-training Paradigm=Training from scratch2024.10 | 42.8 | — | — | — | 48 | 42 | 35.1 | — | — | |
| OSDTWBackbone=ViT-B2026.05 | 42.5 | — | — | — | 49.7 | 41.8 | 30.9 | — | — | |
| APA* + AGLULayerNorm=True, Attention dropout=0.1, Activation=AGLU2024.07 | 42 | — | — | — | — | — | — | — | — | |
| SHIKEBackbone=ResNet152, Model Architecture=DNN-based2024.10 | 41.9 | — | — | — | — | 39.2 | — | 43.6 | 44.8 | |
| NCLBackbone=ResNet152, Model Architecture=DNN-based2024.10 | 41.8 | — | — | — | — | — | — | — | — | |
| GPaCoBackbone=ResNet152, Model Architecture=DNN-based2024.10 | 41.7 | — | — | — | — | 47.2 | — | 39.5 | 33 | |
| APA*LayerNorm=True, Attention dropout=0.12024.07 | 41.3 | — | — | — | — | — | — | — | — | |
| PaCoBackbone=Res152, Tuned Params=60.34M, Total Params=60.34M2022.10 | 41.2 | — | — | — | 36.1 | 47.9 | 35.3 | — | — | |
| PaCoBackbone=ResNet-152, Pre-training=ImageNet, RandAugment=false2021.07 | 41.2 | — | — | — | 37.5 | 47.2 | 33.9 | — | — | |
| PaCoBackbone=ResNet-152, Pre-training=ImageNet, RandAugment=true2021.07 | 41.2 | — | — | — | 36.1 | 47.9 | 35.3 | — | — | |
| PaCoBackbone=ResNet1522026.05 | 41.2 | — | — | — | 36.1 | 47.9 | 35.3 | — | — | |
| TADEBackbone=ResNet1522026.05 | 40.9 | — | — | — | 43.1 | 42.4 | 33.2 | — | — | |
| LiVTBackbone=ViT-B/16, Model Architecture=MHSA-based, Data Modality=Visual-only2024.10 | 40.8 | — | — | — | — | 40.6 | — | 48.1 | 27.5 | |
| LiVTBackbone=ViT-B, Pre-training Paradigm=Training from scratch2024.10 | 40.8 | — | — | — | 48.1 | 40.6 | 27.5 | — | — | |
| LiVTBackbone=ViT-B2026.05 | 40.8 | — | — | — | 48.1 | 40.6 | 27.5 | — | — | |
| CCSAMBackbone=ResNet152, Model Architecture=DNN-based, Optimizer Enhancement=SAM2024.10 | 40.6 | — | — | — | — | 42.1 | — | 41.2 | 36.4 | |
| CC-SAM2024.07 | 40.6 | — | — | — | — | — | — | — | — | |
| GCLBackbone=ResNet1522026.05 | 40.6 | — | — | — | — | — | — | — | — | |
| Baseline with SE2024.07 | 40.5 | — | — | — | — | — | — | — | — | |
| MiSLAS2023.03 | 40.48 | 35.53 | 28.97 | 3 | — | — | — | — | — | |
| PaCo2023.03 | 40.45 | 27.88 | 2.53 | 0 | — | — | — | — | — | |
| MiSLASBackbone=Res152, Tuned Params=60.34M, Total Params=60.34M2022.10 | 40.4 | — | — | — | 39.6 | 43.3 | 36.1 | — | — | |
| RIDEBackbone=ResNet152, Model Architecture=DNN-based2024.10 | 40.4 | — | — | — | — | 40.6 | — | 44.4 | 33 | |
| MisLASBackbone=ResNet152, Model Architecture=DNN-based2024.10 | 40.4 | — | — | — | — | 43.3 | — | 39.6 | 36.1 | |
| MisLAS2024.07 | 40.4 | — | — | — | — | — | — | — | — | |
| MISLASBackbone=ResNet-152, Pre-training=ImageNet, RandAugment=false2021.07 | 40.4 | — | — | — | 39.6 | 43.3 | 36.1 | — | — | |
| MiSLAS + GML (Ensemble)GML plugin=true, Label aware smoothing loss=true, Ensemble=true2023.03 | 40.37 | 35.92 | 30.51 | 5 | — | — | — | — | — | |
| GCLBackbone=ResNet152, Model Architecture=DNN-based2024.10 | 40.3 | — | — | — | — | 42.6 | — | 38.6 | 38.4 | |
| IIF2024.07 | 40.2 | — | — | — | — | — | — | — | — | |
| ALABackbone=Res152, Tuned Params=60.34M, Total Params=60.34M2022.10 | 40.1 | — | — | — | 43.9 | 40.1 | 32.9 | — | — | |
| ALA2024.07 | 40.1 | — | — | — | — | — | — | — | — | |
| MiSLAS + GMLGML plugin=true, Label aware smoothing loss=true2023.03 | 39.9 | 35.41 | 29.98 | 5 | — | — | — | — | — | |
| ResLT2024.07 | 39.8 | — | — | — | — | — | — | — | — | |
| ResLTBackbone=ResNet-152, Pre-training=ImageNet, RandAugment=false2021.07 | 39.8 | — | — | — | 39.8 | 43.6 | 31.4 | — | — | |
| DisAlign2024.07 | 39.3 | — | — | — | — | — | — | — | — | |
| DisAlignBackbone=ResNet1522026.05 | 39.3 | — | — | — | 40.4 | 42.4 | 30.1 | — | — | |
| RSGBackbone=ResNet1522026.05 | 39.3 | — | — | — | 41.9 | 41.4 | 32 | — | — | |
| CNT2024.07 | 39.2 | — | — | — | — | — | — | — | — | |
| TADEBackbone=Res152, Tuned Params=60.34M, Total Params=60.34M2022.10 | 38.8 | — | — | — | 42.8 | 39 | 31.2 | — | — | |
| LADE2024.07 | 38.8 | — | — | — | — | — | — | — | — | |
| LADEBackbone=ResNet1522026.05 | 38.8 | — | — | — | 42.8 | 39 | 31.2 | — | — | |
| Balanced SoftmaxBackbone=ResNet-152, Pre-training=ImageNet, RandAugment=false2021.07 | 38.6 | — | — | — | 42 | 39.3 | 30.5 | — | — | |
| Decouple-τ-normBackbone=ResNet-152, Pre-training=ImageNet, RandAugment=false2021.07 | 37.9 | — | — | — | 37.8 | 40.7 | 31.8 | — | — | |
| LWSBackbone=Res152, Tuned Params=60.34M, Total Params=60.34M2022.10 | 37.6 | — | — | — | 40.6 | 39.1 | 28.6 | — | — | |
| LWSBackbone=ResNet152, Model Architecture=DNN-based2024.10 | 37.6 | — | — | — | — | 39.1 | — | 40.6 | 28.6 | |
| VPTBackbone=ViT-B, Tuned Params=0.09M, Total Params=86.66M2022.10 | 37.5 | — | — | — | 50.4 | 33.8 | 23.3 | — | — | |
| BSCE2023.03 | 37.18 | 29.3 | 5.64 | 0 | — | — | — | — | — | |
| CE + GMLGML plugin=true2023.03 | 36.82 | 29.3 | 8 | 0 | — | — | — | — | — | |
| OLTRBackbone=Res152, Tuned Params=60.34M, Total Params=60.34M2022.10 | 35.9 | — | — | — | 44.7 | 37 | 25.3 | — | — | |
| OLTRBackbone=ResNet-152, Pre-training=ImageNet, RandAugment=false2021.07 | 35.9 | — | — | — | 44.7 | 37 | 25.3 | — | — | |
| PaCoBackbone=ViT-B2026.05 | 35.5 | — | — | — | 51.6 | 32.6 | 13.2 | — | — | |
| FocalBackbone=ResNet1522026.05 | 34.6 | — | — | — | 41.1 | 34.8 | 22.4 | — | — | |
| DeiTBackbone=ViT-B2026.05 | 34.2 | — | — | — | 51.6 | 31 | 9.4 | — | — | |
| MAEBackbone=ViT-B2026.05 | 30.3 | — | — | — | 48.9 | 24.6 | 8.7 | — | — | |
| CE(baseline)Backbone=ResNet-152, Pre-training=ImageNet, RandAugment=false2021.07 | 30.2 | — | — | — | 45.7 | 27.3 | 8.2 | — | — | |
| CBBackbone=ResNet1522026.05 | 30.2 | — | — | — | 45.7 | 27.3 | 8.2 | — | — | |
| CE2023.03 | 28.71 | 12.11 | 0.73 | 0 | — | — | — | — | — |