Visual Question Answering on General VQA Suite
61.1SEED-2 AccuracyGenLIP
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GenLIPArch=g/16, Data=8.0B, Evaluation Protocol=Frozen visual representation, LLM Backbone=LLaVA-NeXT-Qwen2.5-7B2026.05 | 61.1 | 64.4 | 54.5 | 87 | 1,483 | |
| GenLIPArch=So/16, Data=8.0B, Evaluation Protocol=Frozen visual representation, LLM Backbone=LLaVA-NeXT-Qwen2.5-7B2026.05 | 60.8 | 60.5 | 52.4 | 86.4 | 1,424 | |
| GenLIPArch=L/16, Data=8.0B, Evaluation Protocol=Frozen visual representation, LLM Backbone=LLaVA-NeXT-Qwen2.5-7B2026.05 | 59 | 56.4 | 51.3 | 85.4 | 1,320 | |
| SigLIP2Arch=So/16, Data=40.0B, Evaluation Protocol=Frozen visual representation, LLM Backbone=LLaVA-NeXT-Qwen2.5-7B2026.05 | 56.4 | 64.5 | 52.2 | 87.1 | 1,422 | |
| SigLIP2Arch=g/16, Data=40.0B, Evaluation Protocol=Frozen visual representation, LLM Backbone=LLaVA-NeXT-Qwen2.5-7B2026.05 | 56.4 | 62.7 | 49.3 | 87.7 | 1,422 | |
| SigLIPArch=L/16, Data=40.0B, Evaluation Protocol=Frozen visual representation, LLM Backbone=LLaVA-NeXT-Qwen2.5-7B2026.05 | 55.8 | 57.8 | 46.2 | 86.7 | 1,275 | |
| CLIPArch=L/14, Data=12.8B, Evaluation Protocol=Frozen visual representation, LLM Backbone=LLaVA-NeXT-Qwen2.5-7B2026.05 | 55.1 | 49.4 | 39.6 | 85.2 | 1,316 | |
| AIMv2Arch=L/14, Data=12.0B, Evaluation Protocol=Frozen visual representation, LLM Backbone=LLaVA-NeXT-Qwen2.5-7B2026.05 | 55.1 | 44 | 37.9 | 85.2 | 1,240 | |
| OVision2Arch=L/16, Data=12.8B, Evaluation Protocol=Frozen visual representation, LLM Backbone=LLaVA-NeXT-Qwen2.5-7B2026.05 | 53.8 | 60 | 47.2 | 85.9 | 1,325 |