Question Answering on EHRQA (OOD)
95.4AccuracyGemini 2.5 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 2.5 ProModel Scale=Large2025.07 | 95.4 | |
| Gemini 2.5 FlashModel Scale=Large2025.07 | 95 | |
| MedGemma 27B Text-only (RL)Model Scale=Small, Modality=Text-only, Reinforcement Learning (RL)=true2025.07 | 93.6 | |
| o3Model Scale=Large2025.07 | 92.5 | |
| MedGemma 27B Text-onlyModel Scale=Small, Modality=Text-only, Reinforcement Learning (RL)=false2025.07 | 86.3 | |
| Gemma 3 27BModel Scale=Small2025.07 | 84.2 |