Multilingual Medical Reasoning on CUREMED-BENCH (test)
94.96ConsistencyCURE-MED-Qwen2.5-32B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CURE-MED-Qwen2.5-32BModel Scale=Large Models (≥ 14B)2026.01 | 94.96 | 70.04 | |
| CURE-MED-Qwen2.5-14BModel Scale=Large Models (≥ 14B)2026.01 | 90.27 | 63.74 | |
| HuatuoGPT-o1-70BModel Scale=Large Models (≥ 14B)2026.01 | 86.79 | 66.67 | |
| CURE-MED-Qwen2.5-7BModel Scale=Medium Models (7–9B)2026.01 | 85.21 | 54.35 | |
| LLaMA-3.3-Instruct-70BModel Scale=Large Models (≥ 14B)2026.01 | 79.66 | 60.8 | |
| LLaMA-3.1-70BModel Scale=Large Models (≥ 14B)2026.01 | 75.68 | 54.65 | |
| CURE-MED-Qwen2.5-3BModel Scale=Small Models (≤ 3B)2026.01 | 74.28 | 42.93 | |
| Qwen2.5-Instruct-72BModel Scale=Large Models (≥ 14B)2026.01 | 70.73 | 58.8 | |
| OpenBioLLM-Llama3-70BModel Scale=Large Models (≥ 14B)2026.01 | 70.3 | 51.22 | |
| HuatuoGPT-o1-8BModel Scale=Medium Models (7–9B)2026.01 | 67.3 | 46.86 | |
| CURE-MED-Qwen2.5-1.5BModel Scale=Small Models (≤ 3B)2026.01 | 57.6 | 28.32 | |
| UltraMedical LLaMA-3-8BModel Scale=Medium Models (7–9B)2026.01 | 47.03 | 35.29 | |
| Ministral-8BModel Scale=Medium Models (7–9B)2026.01 | 46.93 | 42.87 | |
| Qwen2.5-Instruct-32BModel Scale=Large Models (≥ 14B)2026.01 | 41.51 | 49.69 | |
| LLaMA-3.1-Instruct-8BModel Scale=Medium Models (7–9B)2026.01 | 36.56 | 18.91 | |
| Qwen2.5-Instruct-14BModel Scale=Large Models (≥ 14B)2026.01 | 35.57 | 41.79 | |
| LLaMA-3-8BModel Scale=Medium Models (7–9B)2026.01 | 31.58 | 28.93 | |
| MMed-LLaMA-3.1-70BModel Scale=Large Models (≥ 14B)2026.01 | 26.49 | 37.85 | |
| Apollo2-7BModel Scale=Medium Models (7–9B)2026.01 | 25.63 | 15.93 | |
| Qwen2.5-Instruct-7BModel Scale=Medium Models (7–9B)2026.01 | 25.44 | 29.56 | |
| LLaMA-3.2-3BModel Scale=Small Models (≤ 3B)2026.01 | 23.69 | 10.41 | |
| Gemma-9BModel Scale=Medium Models (7–9B)2026.01 | 23.22 | 36.97 | |
| MMed-Llama-3-8BModel Scale=Medium Models (7–9B)2026.01 | 21.38 | 28.09 | |
| Mistral-7BModel Scale=Medium Models (7–9B)2026.01 | 18.7 | 15.23 | |
| Qwen2.5-Instruct-3BModel Scale=Small Models (≤ 3B)2026.01 | 8.39 | 10.83 | |
| BioMistral-7BModel Scale=Medium Models (7–9B)2026.01 | 7.1 | 4.8 | |
| Qwen2.5-Instruct-1.5BModel Scale=Small Models (≤ 3B)2026.01 | 3.84 | 6.2 | |
| MedAlpaca-7BModel Scale=Medium Models (7–9B)2026.01 | 3.5 | 2.47 | |
| OpenBioLLM-Llama3-8BModel Scale=Medium Models (7–9B)2026.01 | 1.47 | 36.62 | |
| Meditron-7BModel Scale=Medium Models (7–9B)2026.01 | 0.43 | 2.5 | |
| Gemma-7BModel Scale=Medium Models (7–9B)2026.01 | 0.37 | 1.23 | |
| Meditron-70BModel Scale=Large Models (≥ 14B)2026.01 | 0.21 | 4.54 | |
| MedAlpaca-13BModel Scale=Large Models (≥ 14B)2026.01 | 0.1 | 0.07 |