Visual Question Answering on VQA-RAD
85.5Overall AccuracyNVILA
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| NVILASize=8B2024.12 | 85.5 | — | — | — | — | — | |
| VILA-M3Size=8B2024.12 | 84.7 | — | — | — | — | — | |
| Task-specific SOTA2024.12 | 84.2 | — | — | — | — | — | |
| Upper BoundNoise Type=Clean2025.03 | 79.13 | 78.17 | 80.08 | — | — | — | |
| Med-Gemini2024.12 | 78.8 | — | — | — | — | — | |
| PMC-CLIP2023.03 | 77.6 | 67 | 84 | — | — | — | |
| M3AE2023.03 | 77.01 | 67.23 | 83.46 | — | — | — | |
| DiNNoise Type=10%-Semantic Noise2025.03 | 74.24 | 72.68 | 75.81 | — | — | — | |
| OctoMed 7BMedical Samples=8M2026.06 | 74.2 | — | — | — | — | — | |
| QoQ-Med-VL 7BMedical Samples=2.6M2026.06 | 73.21 | — | — | — | — | — | |
| Qwen2.5-VL-7B + OPENMEDREASONMedical Samples=450K2026.06 | 72.51 | — | — | — | — | — | |
| Lingshu 7BMedical Samples=5M2026.06 | 71.23 | — | — | — | — | — | |
| MedVL-Thinker 7BMedical Samples=200k2026.06 | 70.02 | — | — | — | — | — | |
| SNLCNoise Type=10%-Semantic Noise2025.03 | 69.65 | 67.83 | 71.35 | — | — | — | |
| CoDisNoise Type=10%-Semantic Noise2025.03 | 69.53 | 68.02 | 70.54 | — | — | — | |
| Q2ATransformerNoise Type=10%-Semantic Noise2025.03 | 68.48 | 66.79 | 70.17 | — | — | — | |
| BaselineNoise Type=Clean2025.03 | 68.25 | 67.86 | 68.85 | — | — | — | |
| MedGemma 27BMedical Samples=30M2026.06 | 68.12 | — | — | — | — | — | |
| MedGemma 1.5 4BMedical Samples=30M2026.06 | 68.12 | — | — | — | — | — | |
| SimTNoise Type=10%-Semantic Noise2025.03 | 68.04 | 66.93 | 69.73 | — | — | — | |
| CPRD-BAN2023.03 | 67.8 | 52.5 | 77.9 | — | — | — | |
| Qwen2.5-VL-7BMedical Samples=N/A2026.06 | 67.13 | — | — | — | — | — | |
| MMBERTNoise Type=10%-Semantic Noise2025.03 | 66.42 | 63.36 | 68.21 | — | — | — | |
| MEVF-BAN2023.03 | 66.1 | 49.2 | 77.2 | — | — | — | |
| VGS-DecodingModel=MedGemma2026.03 | 64.48 | 53.05 | 73.58 | — | 8.16 | — | |
| DiNNoise Type=20%-Random Noise2025.03 | 63.93 | 61.04 | 65.77 | — | — | — | |
| MaLoRAModel=Qwen2.5-VL-7B, Training examples=1.8k2025.10 | 63.64 | — | — | — | — | — | |
| DoLAModel=MedGemma2026.03 | 63.38 | 51.91 | 72.51 | — | 7.06 | — | |
| LoRAModel=Qwen2.5-VL-7B, Training examples=1.8k2025.10 | 62.75 | — | — | — | — | — | |
| MaLoRAModel=Qwen3-VL-8B, Training examples=1.8k2025.10 | 62.3 | — | — | — | — | — | |
| DiNNoise Type=20%-Semantic Noise2025.03 | 62.28 | 58.06 | 63.17 | — | — | — | |
| SNLCNoise Type=20%-Random Noise2025.03 | 62.03 | 59.21 | 63.84 | — | — | — | |
| SimTNoise Type=20%-Random Noise2025.03 | 60.9 | 57.86 | 62.85 | — | — | — | |
| Q2ATransformerNoise Type=20%-Random Noise2025.03 | 60.68 | 58.04 | 62.37 | — | — | — | |
| CoDisNoise Type=20%-Random Noise2025.03 | 60.32 | 59.95 | 60.56 | — | — | — | |
| BaseModel=Qwen2.5-VL-7B, Training examples=1.8k2025.10 | 59.87 | — | — | — | — | — | |
| QLoRAModel=Qwen2.5-VL-7B, Training examples=1.8k2025.10 | 59.42 | — | — | — | — | — | |
| LoRAModel=Qwen3-VL-8B, Training examples=1.8k2025.10 | 59.42 | — | — | — | — | — | |
| SNLCNoise Type=20%-Semantic Noise2025.03 | 58.88 | 56.45 | 61.3 | — | — | — | |
| BaselineNoise Type=20%-Random Noise2025.03 | 58.88 | 56.71 | 60.3 | — | — | — | |
| OPERAModel=MedGemma2026.03 | 58.27 | 48.9 | 65.74 | — | 1.95 | — | |
| Q2ATransformerNoise Type=20%-Semantic Noise2025.03 | 58.25 | 55.43 | 60.03 | — | — | — | |
| CASTBackbone=LLaVA-1.5-7B, Domain=Medical2026.05 | 58.17 | — | — | — | — | — | |
| MMBERTNoise Type=20%-Random Noise2025.03 | 57.97 | 55.43 | 59.59 | — | — | — | |
| VGS-DecodingModel=LLaVA-Med2026.03 | 57.75 | 38.9 | 72.91 | — | 4.11 | — | |
| BaseModel=Qwen3-VL-8B, Training examples=1.8k2025.10 | 57.64 | — | — | — | — | — | |
| CoDisNoise Type=20%-Semantic Noise2025.03 | 56.42 | 54.19 | 57.28 | — | — | — | |
| GreedyModel=MedGemma2026.03 | 56.32 | 49.5 | 61.75 | — | — | — | |
| QLoRAModel=Qwen3-VL-8B, Training examples=1.8k2025.10 | 56.32 | — | — | — | — | — | |
| BaselineNoise Type=20%-Semantic Noise2025.03 | 56.01 | 54.23 | 57.14 | — | — | — | |
| SimTNoise Type=20%-Semantic Noise2025.03 | 55.82 | 53.76 | 57.05 | — | — | — | |
| MMBERTNoise Type=20%-Semantic Noise2025.03 | 55.25 | 52.68 | 56.64 | — | — | — | |
| VCDModel=MedGemma2026.03 | 54.45 | 50.29 | 57.77 | — | -1.87 | — | |
| GreedyBackbone=LLaVA-1.5-7B, Domain=Medical2026.05 | 54.18 | — | — | — | — | — | |
| GreedyModel=LLaVA-Med2026.03 | 53.64 | 34.45 | 68.92 | — | — | — | |
| MaLoRAModel=LLaVA-1.5-7B, Training examples=1.8k2025.10 | 51.66 | — | — | — | — | — | |
| LoRAModel=LLaVA-1.5-7B, Training examples=1.8k2025.10 | 51.22 | — | — | — | — | — | |
| QLoRAModel=LLaVA-1.5-7B, Training examples=1.8k2025.10 | 50.11 | — | — | — | — | — | |
| VGS-DecodingModel=CheXagent2026.03 | 50.1 | 23.48 | 71.31 | — | 0.86 | — | |
| GreedyModel=CheXagent2026.03 | 49.24 | 22.02 | 70.92 | — | — | — | |
| OPERAModel=LLaVA-Med2026.03 | 49.05 | 33.22 | 61.69 | — | -4.59 | — | |
| VCDModel=CheXagent2026.03 | 47.78 | 21.73 | 68.53 | — | -1.46 | — | |
| VCDModel=LLaVA-Med2026.03 | 47.71 | 30.85 | 61.2 | — | -5.93 | — | |
| OPERAModel=CheXagent2026.03 | 47.67 | 20.5 | 69.32 | — | -1.57 | — | |
| DoLAModel=CheXagent2026.03 | 47.55 | 20.73 | 68.92 | — | -1.69 | — | |
| DoLAModel=LLaVA-Med2026.03 | 47.34 | 32.76 | 58.96 | — | -6.3 | — | |
| BaseModel=LLaVA-1.5-7B, Training examples=1.8k2025.10 | 37.25 | — | — | — | — | — | |
| Base ModelScale=2B2026.06 | — | — | — | — | — | 31.69 | |
| Base ModelScale=4B2026.06 | — | — | — | — | — | 40.37 | |
| BioMed-VITALModel size=13b, Training sample size=60K, Evaluation protocol=Supervised fine-tuning2024.06 | — | — | 84.55 | 64.88 | — | — | |
| BioMed-VITALModel size=13b, Training sample size=150K, Evaluation protocol=Supervised fine-tuning2024.06 | — | — | 84.86 | 69.72 | — | — | |
| BiomedCLIPEvaluation protocol=Literature-reported2024.06 | — | — | 79.8 | 67.6 | — | — | |
| CoQAHEvaluation protocol=Literature-reported2024.06 | — | — | 67.5 | 30.2 | — | — | |
| CPRD-BANPretraining Data=ROCO, MedICaT [46, 52]2023.05 | — | 52.5 | 77.9 | — | — | — | |
| Frozen TeacherScale=2B2026.06 | — | — | — | — | — | 40.37 | |
| Frozen TeacherScale=4B2026.06 | — | — | — | — | — | 42.01 | |
| Judge RewardScale=2B2026.06 | — | — | — | — | — | 35.84 | |
| Judge RewardScale=4B2026.06 | — | — | — | — | — | 41.26 | |
| LLaVAModel size=7b, Training sample size=60K, Evaluation protocol=Supervised fine-tuning2024.06 | — | — | 65.07 | 50 | — | — | |
| LLaVA-MedModel size=7b, Training sample size=60K, Evaluation protocol=Supervised fine-tuning2024.06 | — | — | 84.19 | 61.52 | — | — | |
| LLaVA-MedModel size=13b, Training sample size=60K, Evaluation protocol=Supervised fine-tuning2024.06 | — | — | 77.94 | 64.58 | — | — | |
| M2I2Evaluation protocol=Literature-reported2024.06 | — | — | 83.5 | 66.5 | — | — | |
| M3AEEvaluation protocol=Literature-reported2024.06 | — | — | 83.46 | 67.23 | — | — | |
| M3AEPretraining Data=None2023.05 | — | 66.5 | 79 | — | — | — | |
| M3AEPretraining Data=CC12M [9]2023.05 | — | 67.2 | 83.5 | — | — | — | |
| MedVInT-TDPretraining Data=PMC-VQA2023.05 | — | 73.7 | 86.8 | — | — | — | |
| MedVInT-TD-SPretraining Data=None2023.05 | — | 55.3 | 80.5 | — | — | — | |
| MedVInT-TEPretraining Data=PMC-VQA2023.05 | — | 69.3 | 84.2 | — | — | — | |
| MedVInT-TE-SPretraining Data=None2023.05 | — | 53.6 | 76.5 | — | — | — | |
| MEVF-BANPretraining Data=VQA-RAD [28]2023.05 | — | 49.2 | 77.2 | — | — | — | |
| MMQEvaluation protocol=Literature-reported2024.06 | — | — | 75.8 | 53.7 | — | — | |
| MUMCEvaluation protocol=Literature-reported2024.06 | — | — | 84.2 | 71.5 | — | — | |
| PMC-CLIPEvaluation protocol=Literature-reported2024.06 | — | — | 84 | 67 | — | — | |
| PMC-CLIPPretraining Data=None2023.05 | — | 52 | 75.4 | — | — | — | |
| PMC-CLIPPretraining Data=PMC-OA [32]2023.05 | — | 67 | 84 | — | — | — | |
| PubMedCLIPEvaluation protocol=Literature-reported2024.06 | — | — | 80 | 60.1 | — | — | |
| RLVR OnlyScale=2B2026.06 | — | — | — | — | — | 30.18 | |
| RLVR OnlyScale=4B2026.06 | — | — | — | — | — | 41.13 | |
| T2R-R1Scale=2B2026.06 | — | — | — | — | — | 41.28 | |
| T2R-R1Scale=4B2026.06 | — | — | — | — | — | 38.63 |