Open-domain visual recognition on INFOSEEK (Unseen)
60.3Top-1 AccuracyWikiCLIP-L
Evaluation Results
| Method | Links | |
|---|---|---|
| WikiCLIP-LFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 3B2026.03 | 60.3 | |
| WikiCLIP-SFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 1B2026.03 | 58.5 | |
| CLIP I2I*Finetune Dataset=-2026.03 | 45.6 |