Open-domain visual recognition on E-VQA (Seen)
39.9Top-1 AccuracyWikiCLIP-S
Evaluation Results
| Method | Links | |
|---|---|---|
| WikiCLIP-SFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 1B2026.03 | 39.9 | |
| WikiCLIP-LFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 3B2026.03 | 35.6 | |
| CLIP I2I*Finetune Dataset=-2026.03 | 10.6 |