Medical Question Answering on MIMIC-III (test)
67.05CUS ScoreGPT-4 (Baseline)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4 (Baseline)Train Dataset=MedQA, Inference Framework=Baseline2025.11 | 67.05 | 44.5 | |
| GPT-4 + MedBayes-LiteTrain Dataset=MedQA, Inference Framework=MedBayes-Lite2025.11 | 23.12 | 80.15 |