Clinical Reasoning on HealthBench Professional (525 cases)
62.72Overall ScoreMDIA v1.0.53
Evaluation Results
| Method | Links | |
|---|---|---|
| MDIA v1.0.53Description=Hydra Platform, length-guided synthesizer + verifier, Avg len=2789, Reference=this work2026.05 | 62.72 | |
| MDIA v1.0.50Description=Hydra Platform, Gemini 3.1 Pro, graph endpoint, Avg len=4383, Reference=this work2026.05 | 61.66 | |
| ChatGPT for CliniciansNote=best in OpenAI paper, Reference=OpenAI 20262026.05 | 59 | |
| MDIA v1.0.41Description=Hydra Platform, single-agent endpoint, Reference=this work2026.05 | 57.75 | |
| GPT-5.4 baseReference=OpenAI 20262026.05 | 48.1 | |
| Claude Opus 4.7Reference=OpenAI 20262026.05 | 47 | |
| GPT-5Reference=OpenAI 20262026.05 | 46.2 | |
| GPT-5.2Reference=OpenAI 20262026.05 | 45.9 | |
| Gemini 3.1 ProReference=OpenAI 20262026.05 | 43.8 | |
| Physician-written baselineReference=OpenAI 20262026.05 | 43.7 | |
| Grok 4.20Reference=OpenAI 20262026.05 | 36.1 |