Medical Question Answering on HealthBench Overall
60.1Overall ScoreBaichuan-M2-32B
Evaluation Results
| Method | Links | |
|---|---|---|
| Baichuan-M2-32BType=Specialized LLM2026.02 | 60.1 | |
| o3Type=Closed-source LLM2026.02 | 59.8 | |
| Qwen3-30B-A3B-Instruct + More Query Rubricsbackbone=Qwen3-30B-A3B-Instruct, supervision=More Query Rubrics2026.02 | 59.5 | |
| Qwen3-4B-Instruct + More Query Rubricsbackbone=Qwen3-4B-Instruct, supervision=More Query Rubrics2026.02 | 52.9 | |
| Gemini-2.5-ProType=Closed-source LLM2026.02 | 52 | |
| Qwen3-4B-Instruct + Principle Rubricsbackbone=Qwen3-4B-Instruct, supervision=Principle Rubrics2026.02 | 51.1 | |
| Qwen3-4B-Instruct + Doctor Rubricsbackbone=Qwen3-4B-Instruct, supervision=Doctor Rubrics2026.02 | 51 | |
| Qwen3-235B-InstructType=Open-source LLM2026.02 | 50 | |
| GPT-4.1Type=Closed-source LLM2026.02 | 47.9 | |
| HuatuoGPT-o1-72BType=Specialized LLM2026.02 | 47.9 | |
| Deepseek-R1Type=Open-source LLM2026.02 | 47.4 | |
| Qwen3-4B-Instruct + Draft Rubricsbackbone=Qwen3-4B-Instruct, supervision=Draft Rubrics2026.02 | 46.9 | |
| Qwen3-30B-A3B-InstructType=Our Method baseline2026.02 | 46.8 | |
| Qwen3-32BType=Open-source LLM2026.02 | 46.1 | |
| Qwen3-4B-InstructType=Our Method baseline2026.02 | 40.6 | |
| Claude-3.7-SonnetType=Closed-source LLM2026.02 | 34.6 |