Medical Reasoning on MMLU (val)
77.3Anatomy (AN) AccuracyBaichuan-M1-14B
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Baichuan-M1-14B2025.09 | 77.3 | 83.6 | 87.9 | 80.7 | 89.1 | 88.8 | 81.1 | |
| Qwen3-8B+E2C-(SFT+RL)2025.09 | 77 | 82.2 | 92 | 83 | 92.8 | 86 | 81.1 | |
| ReasonMed-7B2025.09 | 75.6 | 79.3 | 79.2 | 73.4 | 85 | 80.9 | 75.7 | |
| Qwen3-8B + GRPO2025.09 | 75 | 80.9 | 91.3 | 81.8 | 90.4 | 86.2 | 79.1 | |
| Qwen3-8B + E2C-SFT + EF-SFT#Med-Tokens=10M2025.09 | 72.3 | 83.8 | 89.2 | 79.7 | 87.6 | 86.2 | 77.1 | |
| HuatuoGPT-o1-7B2025.09 | 71.9 | 78.5 | 88.2 | 67.6 | 80 | 77.6 | 73.7 | |
| Qwen3-8B + standard SFT#Med-Tokens=286M2025.09 | 68.8 | 80.8 | 89 | 73.7 | 83.3 | 79 | 73.1 | |
| Qwen3-8B2025.09 | 68 | 81.6 | 87.5 | 78 | 85 | 83.8 | 76.8 | |
| Llama3.1-8B + E2C-SFT + EF-SFT#Med-Tokens=10M2025.09 | 61.8 | 69.8 | 75.9 | 64.9 | 82 | 72.5 | 67.5 | |
| Llama3.1-8B + ReasonMed SFT#Med-Tokens=286M2025.09 | 45.9 | 55.4 | 61.8 | 43.2 | 38.1 | 56.9 | 47.5 |