Multi-task Image Classification on TALL-20 (test)
93.5AccuracyFine-tuned
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Fine-tunedBackbone=CLIP ViT-L/142025.12 | 93.5 | 100 | |
| MTLBackbone=CLIP ViT-L/142025.12 | 91.8 | 98.2 | |
| Fine-tunedBackbone=CLIP ViT-B/322025.12 | 89.8 | 100 | |
| MTLBackbone=CLIP ViT-B/322025.12 | 88.9 | 99 | |
| ProDistillBackbone=CLIP ViT-L/14, k=162025.12 | 86.8 | 92.8 | |
| SAMergingBackbone=CLIP ViT-L/14, k=162025.12 | 85.8 | 91.8 | |
| SAMergingBackbone=CLIP ViT-B/32, k=162025.12 | 77.9 | 85.7 | |
| ProDistillBackbone=CLIP ViT-B/32, k=162025.12 | 77.8 | 86.6 |