Multiple-choice Visual Question Answering on PathMMU PubMed (test-tiny)
77.6AccuracyGemini 2.5 pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini 2.5 pro2025.06 | 77.6 | 73 | |
| PathChat+2025.06 | 76.9 | 71.9 | |
| GPT-52025.06 | 74.7 | 69.8 | |
| Expert performance*2025.06 | 72.9 | — | |
| GPT-5-mini2025.06 | 71.9 | 66.5 | |
| Claude Sonnet 42025.06 | 68.7 | 63.7 | |
| HuatuoGPT-Vision2025.06 | 63.7 | 58.4 | |
| PathChat 12025.06 | 63.3 | 58 | |
| Qwen3-VL2025.06 | 62.3 | 56.6 | |
| Llama-3.22025.06 | 58 | 52 | |
| LLaVA-OneVision2025.06 | 49.5 | 43.8 | |
| Quilt-LLaVA2025.06 | 43.8 | 37.7 | |
| PA-LLaVA2025.06 | 42.7 | 36.7 |