Medical Question Answering on PubMedQA Reasoning Required
82AccuracyGPT-4 (Medprompt)
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4 (Medprompt)Prompting Strategy=Medprompt, Few-shot Count (k)=5, Ensemble steps=5x, Fine-tuning=false2023.11 | 82 | |
| Med-PaLM 2Strategy Selection=choose best, Fine-tuning=true2023.11 | 81.8 | |
| Flan-PaLM 540BStrategy Selection=choose best, Fine-tuning=true2023.11 | 79 | |
| GPT-4Prompting Strategy=5-shot, Fine-tuning=false2023.11 | 75.2 | |
| TEXTRESNETmode=deep residual tuning2026.02 | 60.31 | |
| DSPyoptimizer=MIPRO2026.02 | 60.26 | |
| HBCmode=hierarchical imitation learning2026.02 | 58.8 | |
| CoTmode=unoptimized lower bound2026.02 | 57.34 | |
| TextGradsummarization=false2026.02 | 56.96 | |
| TextGradsummarization=true2026.02 | 56.12 |