Medical Question Answering on HealthBench Professional
62.7ScoreMDIA v1.0.53
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MDIA v1.0.53System configuration=length-guided synthesizer + verifier, Grader model=GPT-5.4 low2026.05 | 62.7 | 2,789 | 4.2 | |
| MDIA v1.0.50System configuration=Hydra Platform, full graph endpoint, Grader model=GPT-5.4 low2026.05 | 61.7 | 4,383 | 3.2 | |
| ChatGPT for CliniciansSystem configuration=OpenAI’s best, Grader model=GPT-5.4 low2026.05 | 59 | — | 0.5 | |
| MDIA v1.0.40System configuration=multi-turn flatten + 3.1 Pro, Grader model=GPT-5.4 low2026.05 | 58.5 | — | — | |
| MDIA v1.0.36System configuration=last_user flatten, Grader model=GPT-5.4 low2026.05 | 52.2 | — | 6.3 | |
| GPT-5.4 baseSystem configuration=single-agent, Grader model=GPT-5.4 low2026.05 | 48.1 | — | 10.4 | |
| Physician-written baselineGrader model=GPT-5.4 low2026.05 | 43.7 | — | 14.9 |