Medical Visual Question Answering on VQA-RAD (test)
87.9Closed AccuracyOurs
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| OursModel Scale=13B2025.05 | 87.9 | 76 | — | — | — | — | — | 83.1 | — | — | |
| OursModel Scale=7B2025.05 | 87.1 | 74.3 | — | — | — | — | — | 82 | — | — | |
| MedVInT-TD2025.05 | 86.8 | 73.7 | — | — | — | — | — | 81.6 | — | — | |
| parameter-efficient multi-level prompt frameworkParams=104M2026.05 | 86.8 | — | — | — | — | — | — | — | — | 65.8 | |
| VanillaMoE Model=Med-MoE-Phi, Added Params=3.36B2025.03 | 85.3 | 55.1 | — | — | — | — | — | — | — | — | |
| LLaVA-TriParams=8B2026.05 | 84.9 | — | — | — | — | — | — | — | — | 65.1 | |
| DeRS-SMMoE Model=Med-MoE-Phi, Added Params=5.18M2025.03 | 84.6 | 54.8 | — | — | — | — | — | — | — | — | |
| PREFIX T. MEDICAL LMModel Type=Representative non-VLM2026.04 | 84.3 | — | — | — | — | — | — | — | — | — | |
| MedVInT-TE2025.05 | 84.2 | 69.3 | — | — | — | — | — | 78.2 | — | — | |
| LLaVA-MedParams=7B2026.05 | 84.2 | — | — | — | — | — | — | — | — | 64.7 | |
| LLaVA-MedProtocol=Supervised fine-tuned2026.04 | 84.19 | — | — | — | — | — | — | — | — | 61.52 | |
| PMC-CLIP2025.05 | 84 | 67 | — | — | — | — | — | 77.6 | — | — | |
| DeRS-LMMoE Model=Med-MoE-Phi, Added Params=9.18M2025.03 | 83.8 | 55.3 | — | — | — | — | — | — | — | — | |
| M3AE2025.05 | 83.5 | 67.2 | — | — | — | — | — | 77 | — | — | |
| M2I22025.05 | 83.5 | 66.5 | — | — | — | — | — | 76.8 | — | — | |
| LLaVAParams=7B2026.05 | 83.4 | — | — | — | — | — | — | — | — | 63.7 | |
| PeFoMedParams=33M, Configuration=LoRA2026.05 | 83.4 | — | — | — | — | — | — | — | — | 58.5 | |
| Qwen 2.5 VL (Ours, SFT)Protocol=Supervised fine-tuned2026.04 | 83.2 | — | — | — | — | — | — | — | — | 65.9 | |
| VL ENCODER–DECODERModel Type=Representative non-VLM2026.04 | 82.47 | — | — | — | — | — | — | — | — | 71.49 | |
| VanillaMoE Model=Med-MoE-StableLM, Added Params=1.66B2025.03 | 82.3 | 51 | — | — | — | — | — | — | — | — | |
| LLaVA-Med2025.05 | 82 | 64.4 | — | — | — | — | — | 74.9 | — | — | |
| DeRS-LMMoE Model=Med-MoE-StableLM, Added Params=5.63M2025.03 | 81.6 | 50.4 | — | — | — | — | — | — | — | — | |
| DeRS-SMMoE Model=Med-MoE-StableLM, Added Params=2.17M2025.03 | 81.3 | 51.2 | — | — | — | — | — | — | — | — | |
| Q2ATRANSFORMERModel Type=Representative non-VLM2026.04 | 81.2 | — | — | — | — | — | — | — | — | 79.19 | |
| PUBMEDCLIPModel Type=Representative non-VLM2026.04 | 80 | — | — | — | — | — | — | — | — | 60.1 | |
| BIOMEDCLIPModel Type=Representative non-VLM2026.04 | 79.8 | — | — | — | — | — | — | — | — | 67.6 | |
| GPT-4VMode=zero-shot2026.05 | 78.9 | — | — | — | — | — | — | — | — | 39.5 | |
| CPRD-BAN2025.05 | 77.9 | 52.5 | — | — | — | — | — | 67.8 | — | — | |
| MEVF-BAN2025.05 | 77.2 | 49.2 | — | — | — | — | — | 66.1 | — | — | |
| InternVL-30BProtocol=Zero-shot, Model Type=open-source VLM2026.04 | 76.7 | — | — | — | — | — | — | — | — | 39.4 | |
| InternVL-38BProtocol=Zero-shot, Model Type=open-source VLM2026.04 | 76 | — | — | — | — | — | — | — | — | 43.7 | |
| MASK-DPOBackbone=HuatuoGPT-Vision-7B, Text* Pref.=✓, Img. Pref.=×2026.06 | 73.18 | 43.68 | — | — | — | — | — | — | — | — | |
| InternVL-6BProtocol=Zero-shot, Model Type=open-source VLM2026.04 | 73.1 | — | — | — | — | — | — | — | — | 38.5 | |
| mDPOBackbone=HuatuoGPT-Vision-7B, Text* Pref.=×, Img. Pref.=✓2026.06 | 72.8 | 40.58 | — | — | — | — | — | — | — | — | |
| o1Model Category=Large Models2025.07 | 71.9 | — | — | — | — | — | — | — | 52.5 | — | |
| DPOBackbone=HuatuoGPT-Vision-7B, Text* Pref.=×, Img. Pref.=×2026.06 | 71.65 | 39.47 | — | — | — | — | — | — | — | — | |
| Gemini 1.5 ProModel Category=Large Models2025.07 | 71.4 | — | — | — | — | — | — | — | 54.2 | — | |
| RRPOBackbone=HuatuoGPT-Vision-7B, Text* Pref.=✓, Img. Pref.=×2026.06 | 71.26 | 43.68 | — | — | — | — | — | — | — | — | |
| FIRE-MPOBackbone=HuatuoGPT-Vision-7B, Text* Pref.=✓, Img. Pref.=✓2026.06 | 71.26 | 45.26 | — | — | — | — | — | — | — | — | |
| FIRE-MPOBackbone=Qwen3-VL-4B-Instruct, Text* Pref.=✓, Img. Pref.=✓2026.06 | 71.26 | 41.05 | — | — | — | — | — | — | — | — | |
| Qwen 2.5 VLProtocol=Zero-shot, Model Type=frontier and grounding-aware VLM2026.04 | 70.6 | — | — | — | — | — | — | — | — | 41.9 | |
| Gemini 1.5 FlashModel Category=Large Models2025.07 | 70.2 | — | — | — | — | — | — | — | 53.6 | — | |
| Med-GeminiModel Category=Large Models2025.07 | 69.7 | — | — | — | — | — | — | — | 50.1 | — | |
| MASK-DPOBackbone=Qwen3-VL-4B-Instruct, Text* Pref.=✓, Img. Pref.=×2026.06 | 69.34 | 39.94 | — | — | — | — | — | — | — | — | |
| MedGemma 4BModel Category=Small Models2025.07 | 69.1 | — | — | — | — | — | — | — | 49.9 | — | |
| HuatuoGPT-Vision-7BText* Pref.=-, Img. Pref.=-2026.06 | 68.58 | 40.53 | — | — | — | — | — | — | — | — | |
| mDPOBackbone=Qwen3-VL-4B-Instruct, Text* Pref.=×, Img. Pref.=✓2026.06 | 68.58 | 40 | — | — | — | — | — | — | — | — | |
| GPT-5Protocol=Zero-shot, Model Type=frontier and grounding-aware VLM2026.04 | 67.6 | — | — | — | — | — | — | — | — | 41.3 | |
| DPOBackbone=Qwen3-VL-4B-Instruct, Text* Pref.=×, Img. Pref.=×2026.06 | 67.43 | 38.94 | — | — | — | — | — | — | — | — | |
| RRPOBackbone=Qwen3-VL-4B-Instruct, Text* Pref.=✓, Img. Pref.=×2026.06 | 67.43 | 41.57 | — | — | — | — | — | — | — | — | |
| o3Protocol=Zero-shot, Model Type=frontier and grounding-aware VLM2026.04 | 66.9 | — | — | — | — | — | — | — | — | 36.1 | |
| MMedPOText* Pref.=×, Img. Pref.=×2026.06 | 66.54 | 36.36 | — | — | — | — | — | — | — | — | |
| THYMEProtocol=Zero-shot, Model Type=open-source VLM2026.04 | 66.5 | — | — | — | — | — | — | — | — | 36.2 | |
| GLM-4VProtocol=Zero-shot, Model Type=open-source VLM2026.04 | 66.5 | — | — | — | — | — | — | — | — | 56.9 | |
| LLaVAProtocol=Supervised fine-tuned2026.04 | 65.07 | — | — | — | — | — | — | — | — | 50 | |
| Qwen3-VL-4B-InstructText* Pref.=-, Img. Pref.=-2026.06 | 64.75 | 40 | — | — | — | — | — | — | — | — | |
| STLLaVA-MedText* Pref.=×, Img. Pref.=×2026.06 | 64.38 | 30.17 | — | — | — | — | — | — | — | — | |
| FiSAOText* Pref.=×, Img. Pref.=×2026.06 | 64.11 | 32.7 | — | — | — | — | — | — | — | — | |
| Gemma 2 27BModel Category=Small Models2025.07 | 59.4 | — | — | — | — | — | — | — | 42.7 | — | |
| GLM-4.5VProtocol=Zero-shot, Model Type=frontier and grounding-aware VLM2026.04 | 53.4 | — | — | — | — | — | — | — | — | 48.4 | |
| Gemma 2 4BModel Category=Small Models2025.07 | 48.7 | — | — | — | — | — | — | — | 33.6 | — | |
| Gemini 2.5 ProProtocol=Zero-shot, Model Type=frontier and grounding-aware VLM2026.04 | 39.9 | — | — | — | — | — | — | — | — | 25.8 | |
| Qwen2.5-VL-7BProtocol=Zero-shot, Model Type=open-source VLM2026.04 | 34.9 | — | — | — | — | — | — | — | — | 52.4 | |
| MMADAProtocol=Zero-shot, Model Type=open-source VLM2026.04 | 32.7 | — | — | — | — | — | — | — | — | 7.4 | |
| LLaVAProtocol=Zero-shot, Model Type=open-source VLM2026.04 | 12.5 | — | — | — | — | — | — | — | — | 15.27 | |
| Base Modelbase_model=Qwen2.5-VL-3B-Instruct2026.03 | — | — | 68.53 | 24 | 32.03 | — | — | — | — | — | |
| DeepEyes†Category=Reinforcement Learning Methods, Adaptation=Using the same dataset adapted to medical domains2025.11 | — | — | 56.4 | — | — | — | — | — | — | — | |
| EN-INFbase_model=Qwen2.5-VL-3B-Instruct2026.03 | — | — | 67.73 | 24 | 32.42 | — | — | — | — | — | |
| Gemini-2.5-proFramework=Framework II, Inference Mode=Agent-based, Agent System=Ophiuchus2026.03 | — | — | 63.8 | — | — | — | — | — | — | — | |
| Gemini-3-flashFramework=Framework II, Inference Mode=Direct Inference2026.03 | — | — | 58.8 | — | — | — | — | — | — | — | |
| Gemini-3-flashFramework=Framework II, Inference Mode=Agent-based, Agent System=Ophiuchus2026.03 | — | — | 52 | — | — | — | — | — | — | — | |
| GMAI-VLCategory=Medical-Specific Models2025.11 | — | — | 64.6 | — | — | — | — | — | — | — | |
| GPT-4oCategory=General Vision-Language Models2025.11 | — | — | 54.2 | — | — | — | — | — | — | — | |
| GPT-5Framework=Framework II, Inference Mode=Direct Inference2026.03 | — | — | 64.5 | — | — | — | — | — | — | — | |
| GRIT†Category=Reinforcement Learning Methods, Adaptation=Using the same dataset adapted to medical domains2025.11 | — | — | 54.3 | — | — | — | — | — | — | — | |
| InternVLfine-tuned=false, evaluation=5-fold cross validation2026.03 | — | — | 55.1 | — | — | 57.5 | 62.5 | — | — | — | |
| InternVL-2Category=General Vision-Language Models2025.11 | — | — | 58.8 | — | — | — | — | — | — | — | |
| LLaVA-MedCategory=Medical-Specific Models2025.11 | — | — | 51.4 | — | — | — | — | — | — | — | |
| LLaVA-Medfine-tuned=false, evaluation=5-fold cross validation2026.03 | — | — | 27.4 | — | — | 40.2 | 74.5 | — | — | — | |
| Med-Evobase_model=Qwen2.5-VL-3B-Instruct2026.03 | — | — | 69.32 | 25 | 33.72 | — | — | — | — | — | |
| Med-FlamingoCategory=Medical-Specific Models2025.11 | — | — | 55.8 | — | — | — | — | — | — | — | |
| Med-Flamingofine-tuned=false, evaluation=5-fold cross validation2026.03 | — | — | 44.6 | — | — | 42.8 | 71.8 | — | — | — | |
| Med-R1Category=Reinforcement Learning Methods2025.11 | — | — | 55.9 | — | — | — | — | — | — | — | |
| Med-R1fine-tuned=true, evaluation=5-fold cross validation2026.03 | — | — | 76.9 | — | — | 70.5 | 48.8 | — | — | — | |
| MedCausalXfine-tuned=true, evaluation=5-fold cross validation2026.03 | — | — | 79.8 | — | — | 77.3 | 36.5 | — | — | — | |
| MedCoTfine-tuned=true, evaluation=5-fold cross validation2026.03 | — | — | 75.8 | — | — | 68.2 | 52.2 | — | — | — | |
| MedDrfine-tuned=false, evaluation=5-fold cross validation2026.03 | — | — | 78.5 | — | — | 70.2 | 50.2 | — | — | — | |
| MedEyesBackbone=Qwen2.5-VL-3B, Visual Expert=MedPLIB, Resolution=336x336, Patch size=142025.11 | — | — | 70.7 | — | — | — | — | — | — | — | |
| MedRegAfine-tuned=false, evaluation=5-fold cross validation2026.03 | — | — | 76.9 | — | — | 69.5 | 50.8 | — | — | — | |
| MedVInTCategory=Medical-Specific Models2025.11 | — | — | 45.4 | — | — | — | — | — | — | — | |
| MedVLM-R1Category=Reinforcement Learning Methods2025.11 | — | — | 61.4 | — | — | — | — | — | — | — | |
| MedVLM-R1fine-tuned=true, evaluation=5-fold cross validation2026.03 | — | — | 77.3 | — | — | 71.8 | 47.5 | — | — | — | |
| MeissaFramework=Framework II, Inference Mode=Agent-based, Agent System=Ophiuchus2026.03 | — | — | 70.1 | — | — | — | — | — | — | — | |
| o3Framework=Framework II, Inference Mode=Agent-based, Agent System=Ophiuchus2026.03 | — | — | 66 | — | — | — | — | — | — | — | |
| Ophiuchus-7BFramework=Framework II, Inference Mode=Agent-based, Agent System=Ophiuchus2026.03 | — | — | 73.6 | — | — | — | — | — | — | — | |
| Qwen2.5-VLfine-tuned=false, evaluation=5-fold cross validation2026.03 | — | — | 52.4 | — | — | 54.2 | 65.8 | — | — | — | |
| Qwen2.5-VL-3BCategory=General Vision-Language Models2025.11 | — | — | 47.3 | — | — | — | — | — | — | — | |
| Qwen3-VL-4BFramework=Framework II, Inference Mode=Direct Inference, Training Protocol=SFT2026.03 | — | — | 69.1 | — | — | — | — | — | — | — | |
| Qwen3-VL-4BFramework=Framework II, Inference Mode=Agent-based, Agent System=Ophiuchus2026.03 | — | — | 51.8 | — | — | — | — | — | — | — | |
| RadFMCategory=Medical-Specific Models2025.11 | — | — | 50.6 | — | — | — | — | — | — | — |