Medical Reasoning on MultiMedQA
86.23AccuracyGPT-5-High*
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5-High*Size (# Param.)=100B+, Reasoning Effort=high, Temperature=0.02025.09 | 86.23 | |
| Gemma-4B-Finetuned (NanoFlux-200)Size (# Param.)=4B, FLOPs=2.64×10^162025.09 | 61.2 | |
| Gemma-4B-Finetuned (Full Dataset)Size (# Param.)=4B, FLOPs=3.77×10^172025.09 | 44.7 | |
| Gemma-4BSize (# Param.)=4B2025.09 | 35.6 |