Medical Visual Question Answering on VQA-Med 2019 n=350 (test)
68.3Accuracy (LLM Judge)Gemini-3.5-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3.5-FlashEvaluation Protocol=zero-shot, Model Category=frontier VLMs2026.07 | 68.3 | |
| DiffusionGemmaEvaluation Protocol=per-dataset finetuned, Backbone=diff2026.07 | 66.6 | |
| Claude-Sonnet-4.6Evaluation Protocol=zero-shot, Model Category=frontier VLMs2026.07 | 65.4 | |
| Gemma-4Evaluation Protocol=per-dataset finetuned, Backbone=AR2026.07 | 63.1 | |
| DiffusionGemmaEvaluation Protocol=base (zero-shot), Backbone=diff2026.07 | 62.9 | |
| Gemma-4Evaluation Protocol=base (zero-shot), Backbone=AR2026.07 | 61.4 | |
| GPT-4.1-miniEvaluation Protocol=zero-shot, Model Category=frontier VLMs2026.07 | 58.6 |