Visual Entity Recognition on OVEN entity (test)
65Top-1 Accuracy (Seen)Auto-VER-14B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Auto-VER-14BParadigm=Two-Step Generative, Parameters (B)=14.0, Pre-train Dataset=-2025.10 | 65 | 18.6 | 28.9 | |
| Auto-VER-7BParadigm=Two-Step Generative, Parameters (B)=7.0, Pre-train Dataset=-2025.10 | 62.8 | 16 | 25.5 | |
| KnowCoL-bigGParadigm=Knowledge-Guided Dual-Encoder, Parameters (B)=2.0, Pre-train Dataset=LAION2025.10 | 41.8 | 36.1 | 38.8 | |
| CLIPFusionParadigm=Dual-Encoder, Parameters (B)=0.9, Pre-train Dataset=OpenAI2025.10 | 33.6 | 4.8 | 8.4 | |
| GER-ALDParadigm=Two-Step Generative, Parameters (B)=0.4, Pre-train Dataset=LAION2025.10 | 29.1 | 16.3 | 20.9 | |
| PaLI-17BParadigm=Two-Step Generative, Parameters (B)=17.0, Pre-train Dataset=WebLI2025.10 | 28.3 | 11.2 | 16 | |
| PaLI-3BParadigm=Two-Step Generative, Parameters (B)=3.0, Pre-train Dataset=WebLI2025.10 | 19.1 | 6 | 9.1 | |
| GIT-LargeParadigm=Two-Step Generative, Parameters (B)=0.4, Pre-train Dataset=WebLI2025.10 | 17.6 | 4.3 | 7 | |
| CLIP2CLIPParadigm=Dual-Encoder, Parameters (B)=0.9, Pre-train Dataset=OpenAI2025.10 | 12.6 | 10.5 | 11.4 | |
| BLIP-v2Paradigm=Two-Step Generative, Parameters (B)=12.2, Pre-train Dataset=-2025.10 | 8.6 | 3.4 | 4.9 | |
| CLIPParadigm=Dual-Encoder, Parameters (B)=0.4, Pre-train Dataset=OpenAI2025.10 | 5.6 | 4.9 | 5.2 |