Image Classification on STL-10 OOD
98.6AccuracyLP-FT + VRF
Evaluation Results
| Method | Links | |
|---|---|---|
| LP-FT + VRFBackbone=CLIP ViT-B/162024.11 | 98.6 | |
| Zero-shotBackbone=CLIP ViT-B/162024.11 | 98.4 | |
| E2E-FT + VRFBackbone=CLIP ViT-B/162024.11 | 98.4 | |
| LP-FT + WSEBackbone=CLIP ViT-B/162024.11 | 97.9 | |
| E2E-FT + WSEBackbone=CLIP ViT-B/162024.11 | 97.8 | |
| Linear classifierBackbone=CLIP ViT-B/162024.11 | 97.7 | |
| LP-FT + OSEBackbone=CLIP ViT-B/162024.11 | 97.7 | |
| LP-FT + VRFBackbone=CLIP ViT-B/322024.11 | 97.5 | |
| E2E-FT + VRFBackbone=CLIP ViT-B/322024.11 | 97.3 | |
| Zero-shotBackbone=CLIP ViT-B/322024.11 | 97.1 | |
| Linear classifierBackbone=CLIP ViT-B/322024.11 | 96.6 | |
| E2E-FT + OSEBackbone=CLIP ViT-B/162024.11 | 96.6 | |
| LP-FT + WSEBackbone=CLIP ViT-B/322024.11 | 96.4 | |
| LP-FT + OSEBackbone=CLIP ViT-B/322024.11 | 96.4 | |
| LP-FTBackbone=CLIP ViT-B/162024.11 | 96.3 | |
| E2E-FTBackbone=CLIP ViT-B/162024.11 | 96.1 | |
| E2E-FT + OSEBackbone=CLIP ViT-B/322024.11 | 95.9 | |
| E2E-FT + WSEBackbone=CLIP ViT-B/322024.11 | 95.7 | |
| LP-FTBackbone=CLIP ViT-B/322024.11 | 95 | |
| E2E-FTBackbone=CLIP ViT-B/322024.11 | 93.5 | |
| ResNeXt41-WMCGParams (M)=7.97, MACs (G)=10.05, MACs/Params (G/M)=1.28, Training Time (s/epoch)=31, Training VRAM Footprint (MB)=23184, Inference Time (s)=112023.05 | 83.71 | |
| SESNParams (M)=10.96, MACs (G)=227.02, MACs/Params (G/M)=28.47, Training Time (s/epoch)=89, Training VRAM Footprint (MB)=30440, Inference Time (s)=482023.05 | 82.3 | |
| ResNeXt41Params (M)=8.15, MACs (G)=10.05, MACs/Params (G/M)=1.26, Training Time (s/epoch)=27, Training VRAM Footprint (MB)=21886, Inference Time (s)=112023.05 | 81.13 | |
| RST-CNNParams (M)=9.74, MACs (G)=850.23, MACs/Params (G/M)=106.62, Training Time (s/epoch)=437, Training VRAM Footprint (MB)=79248, Inference Time (s)=1842023.05 | 79.35 |