Medical on HealthBench-500
43.6ScoreHeRL
Evaluation Results
| Method | Links | |
|---|---|---|
| HeRLBackbone=Qwen3-4B-Instruct-2507, Training Method=HeRL2026.03 | 43.6 | |
| Qwen3-4B-Instruct-2507Backbone=Qwen3-4B-Instruct-2507, Training Method=Initial2026.03 | 42 | |
| RLVRBackbone=Qwen3-4B-Instruct-2507, Training Method=RLVR2026.03 | 41.7 | |
| DPOBackbone=Qwen3-4B-Instruct-2507, Training Method=DPO2026.03 | 39.1 | |
| SFTBackbone=Qwen3-4B-Instruct-2507, Training Method=SFT2026.03 | 36 | |
| HeRLBackbone=Qwen2.5-7B-Instruct, Training Method=HeRL2026.03 | 34.3 | |
| RLVRBackbone=Qwen2.5-7B-Instruct, Training Method=RLVR2026.03 | 30.5 | |
| DPOBackbone=Qwen2.5-7B-Instruct, Training Method=DPO2026.03 | 28 | |
| SFTBackbone=Qwen2.5-7B-Instruct, Training Method=SFT2026.03 | 27.2 | |
| HeRLBackbone=Llama-3.2-3B-Instruct, Training Method=HeRL2026.03 | 26.6 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct, Training Method=Initial2026.03 | 24.4 | |
| SFTBackbone=Llama-3.2-3B-Instruct, Training Method=SFT2026.03 | 21 | |
| RLVRBackbone=Llama-3.2-3B-Instruct, Training Method=RLVR2026.03 | 17.8 | |
| Llama-3.2-3B-InstructBackbone=Llama-3.2-3B-Instruct, Training Method=Initial2026.03 | 14.5 | |
| DPOBackbone=Llama-3.2-3B-Instruct, Training Method=DPO2026.03 | 13.5 |