Medical Question Answering on PubMedQA (test)
12.2CUS ScoreGPT-3.5-turbo (Baseline)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-3.5-turbo (Baseline)Train Dataset=MedQA, Inference Framework=Baseline2025.11 | 12.2 | 97.58 | |
| GPT-4o (Baseline)Train Dataset=MedQA, Inference Framework=Baseline2025.11 | 8.03 | 90.1 | |
| GPT-3.5-turbo + MedBayes-LiteTrain Dataset=MedQA, Inference Framework=MedBayes-Lite2025.11 | 7.11 | 98.2 | |
| GPT-4o + MedBayes-LiteTrain Dataset=MedQA, Inference Framework=MedBayes-Lite2025.11 | 5.98 | 94.53 |