Medical Visual Question Answering on OMVQA
84.92AccuracyHulu-Med-32B
Evaluation Results
| Method | Links | |
|---|---|---|
| Hulu-Med-32BModel Size=>10B, Model Domain=Domain-specific2026.06 | 84.92 | |
| InternVL3.5Type=Comprehension only, # Params=8B, # Data=16.3M, Evaluation Protocol=Partially trained on evaluation benchmarks2026.06 | 84.5 | |
| Aloe-Vision-72B-ARModel Size=>10B, Model Domain=Domain-specific2026.06 | 83.97 | |
| Hulu-Med-7BModel Size=<10B, Model Domain=Domain-specific2026.06 | 83.73 | |
| Lingshu-32BModel Size=>10B, Model Domain=Domain-specific2026.06 | 83.45 | |
| Lingshu-7BModel Size=<10B, Model Domain=Domain-specific2026.06 | 82.05 | |
| Aloe-Vision-72BModel Size=>10B, Model Domain=Domain-specific2026.06 | 81.77 | |
| Qwen3-VL-30B-A3B-InstructModel Size=>10B, Model Domain=General2026.06 | 78.47 | |
| Lingshu-7BType=Comprehension only, # Params=7B, # Data=7.1M, Evaluation Protocol=Partially trained on evaluation benchmarks2026.06 | 78.4 | |
| Qwen3-VL-8B-InstructModel Size=<10B, Model Domain=General2026.06 | 77.78 | |
| Aloe-Vision-7B-ARModel Size=<10B, Model Domain=Domain-specific2026.06 | 77.1 | |
| Qwen2-VL-72B-InstructModel Size=>10B, Model Domain=General2026.06 | 76.09 | |
| Aloe-Vision-7BModel Size=<10B, Model Domain=Domain-specific2026.06 | 75.87 | |
| Qwen3-VLType=Comprehension only, # Params=8B, # Data=-, Evaluation Protocol=Partially trained on evaluation benchmarks2026.06 | 75.3 | |
| HealthGPT-L14Type=Comprehension only, # Params=14B, # Data=1.5M, Evaluation Protocol=Partially trained on evaluation benchmarks2026.06 | 74.4 | |
| GLM-4.5VModel Size=>10B, Model Domain=Domain-specific2026.06 | 73.24 | |
| Kimi-VL-A3B-InstructModel Size=>10B, Model Domain=General2026.06 | 73.23 | |
| Chiron-o1-8BModel Size=<10B, Model Domain=Domain-specific2026.06 | 72.1 | |
| HuatuoGPT-Vision-7BModel Size=<10B, Model Domain=Domain-specific2026.06 | 71.91 | |
| MedQwen# Params=7B, Medical VLM=true2026.04 | 70.6 | |
| Qwen2-VL-7B-InstructModel Size=<10B, Model Domain=General2026.06 | 70.44 | |
| MEDSIGHTType=Unified, # Params=8B, # Data=72K, Evaluation Protocol=Zero-shot inference2026.06 | 68.9 | |
| HealthGPT-M3Type=Comprehension only, # Params=3.8B, # Data=1.5M, Evaluation Protocol=Partially trained on evaluation benchmarks2026.06 | 68.5 | |
| GPT-5.2Model Size=Large, Model Domain=General2026.06 | 67.74 | |
| HuatuoGPT-Vision-34BModel Size=>10B, Model Domain=Domain-specific2026.06 | 67.46 | |
| HealthGPT-L14# Params=14B, Medical VLM=true2026.04 | 67.2 | |
| HuatuoGPT-VisionType=Comprehension only, # Params=7B, # Data=647K, Evaluation Protocol=Zero-shot inference2026.06 | 66.4 | |
| Llama-3.2# Params=11B, Medical VLM=false2026.04 | 63.2 | |
| Llama-3.2Type=Comprehension only, # Params=11B, # Data=-, Evaluation Protocol=Zero-shot inference2026.06 | 63.2 | |
| MiMo-VL-7B-RLModel Size=<10B, Model Domain=Domain-specific2026.06 | 62.22 | |
| MedPLIBType=Unified, # Params=14B/7B, # Data=500K, Evaluation Protocol=Zero-shot inference2026.06 | 61.9 | |
| Qwen-2.5-VL# Params=7B, Medical VLM=false2026.04 | 60.8 | |
| InternVL2# Params=8B, Medical VLM=false2026.04 | 54.5 | |
| InternVL2Type=Comprehension only, # Params=8B, # Data=7.3M, Evaluation Protocol=Zero-shot inference2026.06 | 54.5 | |
| Yi-VL# Params=6B, Medical VLM=false2026.04 | 50.2 | |
| Yi-VLType=Comprehension only, # Params=6B, # Data=10K, Evaluation Protocol=Zero-shot inference2026.06 | 50.2 | |
| LLaVA-v1.5# Params=7B, Medical VLM=false2026.04 | 44.7 | |
| LLaVA-v1.5Type=Comprehension only, # Params=7B, # Data=158K, Evaluation Protocol=Zero-shot inference2026.06 | 44.7 | |
| LLaVA-MedType=Comprehension only, # Params=7B, # Data=60K, Evaluation Protocol=Zero-shot inference2026.06 | 41.3 | |
| HuatuoGPT-Vision# Params=7B, Medical VLM=true2026.04 | 39.9 | |
| Med-FlamingoType=Comprehension only, # Params=8.3B, # Data=1.3M, Evaluation Protocol=Zero-shot inference2026.06 | 34.9 | |
| HealthGPT-M3# Params=3.8B, Medical VLM=true2026.04 | 32.5 | |
| LLaVA-Med# Params=7B, Medical VLM=true2026.04 | 31.8 | |
| InstructBLIP# Params=7B, Medical VLM=false2026.04 | 29 | |
| InstructBLIPType=Comprehension only, # Params=7B, # Data=364K, Evaluation Protocol=Zero-shot inference2026.06 | 29 | |
| BLIP-2# Params=6.7B, Medical VLM=false2026.04 | 26.9 | |
| BLIP-2Type=Comprehension only, # Params=6.7B, # Data=-, Evaluation Protocol=Zero-shot inference2026.06 | 26.9 | |
| Med-Flamingo# Params=8.3B, Medical VLM=true2026.04 | 24.6 | |
| OMG-LLaVAType=Unified, # Params=7B, # Data=1.2M, Evaluation Protocol=Zero-shot inference2026.06 | 18.3 |