Long-tail Image Classification on Places LT
52.2Overall AccuracyLIFT w/ TTE
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LIFT w/ TTEBackbone=ViT-B/16, Learnable Params.=0.18M, #Epochs=10, TTE=true2023.09 | 52.2 | 51.7 | 53.1 | 50.9 | |
| LIFTBackbone=ViT-B/16, Learnable Params.=0.18M, #Epochs=10, TTE=false2023.09 | 51.5 | 51.3 | 52.2 | 50.5 | |
| LPTBackbone=ViT-B/16, Learnable Params.=1.01M, #Epochs=40+402023.09 | 50.1 | 49.3 | 52.3 | 46.9 | |
| VL-LTRBackbone=ViT-B/16, Learnable Params.=149.62M, #Epochs=1002023.09 | 50.1 | 54.2 | 48.5 | 42 | |
| BALLADBackbone=ViT-B/16, Learnable Params.=149.62M, #Epochs=50+102023.09 | 49.5 | 49.3 | 50.2 | 48.4 | |
| RACBackbone=ViT-B/16, Learnable Params.=85.80M, #Epochs=302023.09 | 47.2 | 48.7 | 48.3 | 41.8 | |
| DecoderBackbone=ViT-B/16, Learnable Params.=21.26M, #Epochs=~342023.09 | 46.8 | — | — | — | |
| PaCoBackbone=ResNet-152, Learnable Params.=58.14M, #Epochs=302023.09 | 41.2 | 36.1 | 47.9 | 35.3 | |
| LiVTBackbone=ViT-B/16, Learnable Params.=85.80M, #Epochs=1002023.09 | 40.8 | 48.1 | 40.6 | 27.5 | |
| MiSLASBackbone=ResNet-152, Learnable Params.=58.14M, #Epochs=90+102023.09 | 40.4 | 39.6 | 43.3 | 36.1 | |
| ALABackbone=ResNet-152, Learnable Params.=58.14M, #Epochs=302023.09 | 40.1 | 43.9 | 40.1 | 32.9 | |
| DisAlignBackbone=ResNet-152, Learnable Params.=58.14M, #Epochs=302023.09 | 39.3 | 40.4 | 42.4 | 30.1 | |
| LWSBackbone=ResNet-152, Learnable Params.=58.14M, #Epochs=90+102023.09 | 37.6 | 40.6 | 39.1 | 28.6 | |
| cRTBackbone=ResNet-152, Learnable Params.=58.14M, #Epochs=90+102023.09 | 36.7 | 42 | 37.6 | 24.9 | |
| OLTRBackbone=ResNet-152, Learnable Params.=58.14M, #Epochs=302023.09 | 35.9 | 44.7 | 37 | 25.3 |