Medical Reasoning on DeepTumorVQA refined 2025b
0.77Fatty Liver Accuracy3DMedAgent (GPT-5)
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| 3DMedAgent (GPT-5)Base Model=GPT-5, Evaluation Protocol=zero-shot2026.02 | 0.77 | 0.8 | 0.58 | 0.72 | 0.77 | 0.53 | 0.7 | |
| 3DMedAgent (Qwen3-VL)Base Model=Qwen3-VL (30B), Evaluation Protocol=zero-shot2026.02 | 0.63 | 0.73 | 0.52 | 0.62 | 0.6 | 0.43 | 0.59 | |
| HuatuoGPTParameters=34B, Evaluation Protocol=zero-shot2026.02 | 0.35 | 0.47 | 0.47 | 0.18 | 0.47 | 0.2 | 0.36 | |
| RandType=Random baseline2026.02 | 0.33 | 0.5 | 0.5 | 0.33 | 0.5 | 0.25 | 0.4 | |
| GPT-5Evaluation Protocol=zero-shot2026.02 | 0.3 | 0.44 | 0.5 | 0.3 | 0.65 | 0.4 | 0.43 | |
| Qwen3-VLParameters=30B, Evaluation Protocol=zero-shot2026.02 | 0.3 | 0.63 | 0.58 | 0.18 | 0.65 | 0.37 | 0.45 | |
| MedGemmaParameters=27B, Evaluation Protocol=zero-shot2026.02 | 0.3 | 0.43 | 0.53 | 0.23 | 0.47 | 0.13 | 0.35 | |
| RadFMEvaluation Protocol=zero-shot2026.02 | 0.28 | 0.3 | 0.52 | 0.32 | 0.53 | 0.25 | 0.37 | |
| M3DEvaluation Protocol=zero-shot2026.02 | 0.27 | 0.44 | 0.52 | 0.52 | 0.52 | 0.2 | 0.42 |