Medical Question Answering on MedQA (Acc, BAS, ECE, AURC)
92.1AccuracyDS-R1
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DS-R1Model scale group=Frontier / Large Models (> 100B params)2026.04 | 92.1 | 76 | 2.6 | 3 | |
| DS-V3.2Model scale group=Frontier / Large Models (> 100B params)2026.04 | 91.8 | 76 | 3.3 | 2 | |
| GPT-4oModel scale group=Frontier / Large Models (> 100B params)2026.04 | 91.3 | 70 | 3.5 | 5 | |
| GPT-o1Model scale group=Frontier / Large Models (> 100B params)2026.04 | 91 | 74 | 2.6 | 2 | |
| Grok-3Model scale group=Frontier / Large Models (> 100B params)2026.04 | 91 | 73 | 5.9 | 3 | |
| G3 MiniModel scale group=Mid-tier Models (10B to 70B params)2026.04 | 86.9 | 68 | 4.4 | 4 | |
| Mist(M)Model scale group=Mid-tier Models (10B to 70B params)2026.04 | 84.8 | 57 | 6.4 | 8 | |
| Llama 3.3Model scale group=Mid-tier Models (10B to 70B params)2026.04 | 84 | 57 | 3.6 | 10 | |
| Phi-4Model scale group=Small / Efficient Models (<10B params or highly optimized)2026.04 | 80.8 | 39 | 14.2 | 11 | |
| Mist(S)Model scale group=Small / Efficient Models (<10B params or highly optimized)2026.04 | 80 | 47 | 11.4 | 11 | |
| 4o-miniModel scale group=Small / Efficient Models (<10B params or highly optimized)2026.04 | 79.8 | 48 | 10.6 | 10 | |
| Mist(L)Model scale group=Frontier / Large Models (> 100B params)2026.04 | 75.3 | 51 | 11.1 | 7 |