Anatomical identification and explanation on Instruction-following dataset 40-case (held-out subset)
4.5Expert ScoreSFT VLM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SFT VLMTraining Mode=Supervised Fine-Tuning, Vision Encoder=Frozen, Vision Merger=Fine-tuned, Language Model=Fine-tuned2025.12 | 4.5 | 33 | |
| DPO VLMTraining Mode=Direct Preference Optimization, Vision Encoder=Fine-tuned, Vision Merger=Fine-tuned, Language Model=Fine-tuned2025.12 | 4.45 | 26 | |
| Base VLMTraining Mode=Pre-trained base2025.12 | 1.05 | 0 |