Open-domain visual recognition on INFOSEEK (Seen)
69.6Top-1 AccuracyWikiCLIP-L
Evaluation Results
| Method | Links | |
|---|---|---|
| WikiCLIP-LFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 3B2026.03 | 69.6 | |
| WikiCLIP-SFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 1B2026.03 | 69.3 | |
| CLIP I2I*Finetune Dataset=-2026.03 | 46.5 |