Multilingual Medical Reasoning on CUREMED-BENCH (averaged across 13 languages)
93.43Language ConsistencyClaude 3 Haiku
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Claude 3 Haikumode=Inference-only2026.01 | 93.43 | 73.31 | |
| GPT-5-minimode=Inference-only2026.01 | 75.33 | 80.57 | |
| GPT-5-nanomode=Inference-only2026.01 | 69.11 | 73.24 | |
| Gemini 2.5 Flashmode=Inference-only2026.01 | 48.01 | 54.79 | |
| Gemini 2.5 Promode=Inference-only2026.01 | 4.33 | 10.62 |