Open-domain visual recognition on E-VQA (Overall)
47.4Top-1 AccuracyGoogle Lens
Evaluation Results
| Method | Links | |
|---|---|---|
| Google LensFinetune Dataset=Google Lens2026.03 | 47.4 | |
| EchosightFinetune Dataset=E-VQA2026.03 | 36.5 | |
| WikiCLIP-LFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 3B2026.03 | 31.9 | |
| WikiCLIP-SFinetune Dataset=OVEN, Text Encoder=LLaMa3.2 1B2026.03 | 30.7 | |
| CLIP I2I*Finetune Dataset=-2026.03 | 13.3 | |
| CLIP I2T*Finetune Dataset=-2026.03 | 3.3 |