Anatomical identification and explanation on Instruction-following dataset (test)
0.28BLEUSFT VLM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SFT VLMTraining Mode=Supervised Fine-Tuning, Vision Encoder=Frozen, Vision Merger=Fine-tuned, Language Model=Fine-tuned2025.12 | 0.28 | 0.55 | 3.85 | |
| DPO VLMTraining Mode=Direct Preference Optimization, Vision Encoder=Fine-tuned, Vision Merger=Fine-tuned, Language Model=Fine-tuned2025.12 | 0.27 | 0.54 | 3.91 | |
| Base VLMTraining Mode=Pre-trained base2025.12 | 0.11 | 0.26 | 1.76 |