Open-domain visual recognition on E-VQA (Unseen)
30.7Top-1 AccuracyWikiCLIP-L
Evaluation Results
| Method | Links | |
|---|---|---|
| WikiCLIP-LFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 3B2026.03 | 30.7 | |
| WikiCLIP-SFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 1B2026.03 | 27.7 | |
| CLIP I2I*Finetune Dataset=-2026.03 | 14.6 |