Image Classification on DomainNet (OOD Evaluation)
30.42OOD Average AccuracyTPGM
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| TPGMPre-trained backbone=CLIP ResNet50, Training data percentage=10%2023.03 | 30.42 | 29.88 | 36.8 | 19.72 | 35.28 | 59.27 | |
| PFPre-trained backbone=CLIP ResNet50, Training data percentage=10%2023.03 | 29.99 | 27.87 | 38.31 | 19.85 | 33.92 | 57.01 | |
| LP-FTPre-trained backbone=CLIP ResNet50, Training data percentage=10%2023.03 | 23.64 | 20.54 | 30.89 | 13.58 | 29.55 | 23.77 | |
| L2-SPPre-trained backbone=CLIP ResNet50, Training data percentage=10%2023.03 | 22.99 | 22.61 | 30.48 | 12.28 | 26.59 | 20.37 | |
| HIRPG (+) CONANType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 22.66 | — | — | — | — | — | |
| Manually AnnotatedType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 20.29 | — | — | — | — | — | |
| HIRPGType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 20.18 | — | — | — | — | — | |
| Vanilla FTPre-trained backbone=CLIP ResNet50, Training data percentage=10%2023.03 | 19.1 | 17.48 | 25.6 | 10.3 | 23.01 | 0 | |
| LPPre-trained backbone=CLIP ResNet50, Training data percentage=10%2023.03 | 18.81 | 17.81 | 22.71 | 17.13 | 17.59 | -1.52 | |
| CHB (+) CONANType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 17.49 | — | — | — | — | — | |
| LE (+) CONANType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 17.26 | — | — | — | — | — | |
| MARS-SPPre-trained backbone=CLIP ResNet50, Training data percentage=10%2023.03 | 16.34 | 15.34 | 21.57 | 8.49 | 19.96 | -14.44 | |
| SC (+) CONANType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 15.19 | — | — | — | — | — | |
| LEType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 14.7 | — | — | — | — | — | |
| CHBType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 14.62 | — | — | — | — | — | |
| CCG (+) CONANType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 14.37 | — | — | — | — | — | |
| SCType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 12.36 | — | — | — | — | — | |
| SD-ClfType=Training-free, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 11.85 | — | — | — | — | — | |
| CCGType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 11.57 | — | — | — | — | — | |
| Glide-synType=Training-dependent, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 9.31 | — | — | — | — | — | |
| SuS-X-SDType=Training-free, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 7.5 | — | — | — | — | — | |
| VisDescType=Training-free, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 6.52 | — | — | — | — | — | |
| CALIPType=Training-free, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 6.39 | — | — | — | — | — | |
| CuPLType=Training-free, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 6.36 | — | — | — | — | — | |
| CLIP-ZSType=Training-free, Vision Encoder=ResNet50, Pre-training=YFCC100M-CLIP, Setup=Joint training2024.03 | 4.9 | — | — | — | — | — |