Medical Question Answering on Aggregate MedQA MedMCQA PubMedQA MMLU
86.7AccuracyMedAgents
Evaluation Results
| Method | Links | |
|---|---|---|
| MedAgentsBackbone=GPT-4, Evaluation Protocol=zero-shot setting2023.11 | 86.7 | |
| MedAgentsBackbone=GPT-3.5, Evaluation Protocol=zero-shot setting2023.11 | 72.1 | |
| Few-shot CoTBackbone=Flan-PaLM, Evaluation Protocol=few-shot setting2023.11 | 71.2 |