Visual Question Answering on VQA-RAD Open (Token Recall)
73.7Token RecallMedVInT-TD
Evaluation Results
| Method | Links | |
|---|---|---|
| MedVInT-TDParams=8.6B2026.05 | 73.7 | |
| FAVP (Vicuna)Params=8.5B2026.05 | 71.9 | |
| MedVInT-TEParams=8.6B2026.05 | 69.3 | |
| LLaVA-MedParams=7B2026.05 | 64.8 | |
| PubMedCLIPParams=1.6B2026.05 | 60.1 | |
| RoiMAMParams=1.7B2026.05 | 56.3 | |
| PMC-CLIPParams=1.6B2026.05 | 52 | |
| CLAREBackbone (Size)=Qwen2-vl (7B)2025.08 | 48 | |
| FT RAGBackbone (Size)=Qwen2-vl (7B)2025.08 | 45 | |
| CLARE + PDistBackbone (Size)=Qwen2-vl (7B)2025.08 | 45 | |
| CLAREBackbone (Size)=Pixtral (12B)2025.08 | 45 | |
| MEDSIGHTFine-tuning protocol=LoRA, LoRA rank=322026.06 | 43.9 | |
| HuatuoGPT-Vision 7BFine-tuning protocol=LoRA, LoRA rank=322026.06 | 41.2 | |
| ReaderBackbone (Size)=Qwen2-vl (7B)2025.08 | 41 | |
| FT RAGBackbone (Size)=Pixtral (12B)2025.08 | 41 | |
| CLARE + PDistBackbone (Size)=Pixtral (12B)2025.08 | 41 | |
| MMed-RAGBackbone (Size)=LLaVA (7B)2025.08 | 39 | |
| ExGra-MedFine-tuning protocol=LoRA, LoRA rank=322026.06 | 38.9 | |
| ReaderBackbone (Size)=Pixtral (12B)2025.08 | 38 | |
| LLaVA-Med 1.5Fine-tuning protocol=LoRA, LoRA rank=322026.06 | 36.7 |