Image Classification on Entity-30 OOD
72.9AccuracyLP-FT + VRF
Evaluation Results
| Method | Links | |
|---|---|---|
| LP-FT + VRFBackbone=CLIP ViT-B/162024.11 | 72.9 | |
| E2E-FT + VRFBackbone=CLIP ViT-B/162024.11 | 72.7 | |
| LP-FT + WSEBackbone=CLIP ViT-B/162024.11 | 72.1 | |
| E2E-FT + WSEBackbone=CLIP ViT-B/162024.11 | 71.9 | |
| LP-FT + OSEBackbone=CLIP ViT-B/162024.11 | 71.8 | |
| E2E-FT + OSEBackbone=CLIP ViT-B/162024.11 | 71.5 | |
| LP-FT + VRFBackbone=CLIP ViT-B/322024.11 | 70.1 | |
| Linear classifierBackbone=CLIP ViT-B/162024.11 | 69.6 | |
| E2E-FT + VRFBackbone=CLIP ViT-B/322024.11 | 69.5 | |
| E2E-FT + WSEBackbone=CLIP ViT-B/322024.11 | 68.8 | |
| LP-FT + WSEBackbone=CLIP ViT-B/322024.11 | 68.8 | |
| LP-FTBackbone=CLIP ViT-B/162024.11 | 68.8 | |
| LP-FT + OSEBackbone=CLIP ViT-B/322024.11 | 68.5 | |
| Zero-shotBackbone=CLIP ViT-B/162024.11 | 68.2 | |
| E2E-FTBackbone=CLIP ViT-B/162024.11 | 68.2 | |
| Linear classifierBackbone=CLIP ViT-B/322024.11 | 68.1 | |
| LP-FTBackbone=CLIP ViT-B/322024.11 | 67.7 | |
| Zero-shotBackbone=CLIP ViT-B/322024.11 | 66.5 | |
| E2E-FT + OSEBackbone=CLIP ViT-B/322024.11 | 66.4 | |
| E2E-FTBackbone=CLIP ViT-B/322024.11 | 65.1 |