Multi-task Image Classification on TALL-14 (test)
93.4AccuracyFine-tuned
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Fine-tunedBackbone=CLIP ViT-L/142025.12 | 93.4 | 100 | |
| MTLBackbone=CLIP ViT-L/142025.12 | 91.6 | 98.1 | |
| SAMergingBackbone=CLIP ViT-L/14, k=162025.12 | 89.1 | 95.4 | |
| ProDistillBackbone=CLIP ViT-L/14, k=162025.12 | 89 | 95.3 | |
| Fine-tunedBackbone=CLIP ViT-B/322025.12 | 88.5 | 100 | |
| MTLBackbone=CLIP ViT-B/322025.12 | 87.7 | 99.1 | |
| SAMergingBackbone=CLIP ViT-B/32, k=162025.12 | 81.2 | 91.8 | |
| ProDistillBackbone=CLIP ViT-B/32, k=162025.12 | 80.5 | 91 |