Medical Reasoning on MEDREASON
16.4Best-of-16 Delta (Δ)Expert Reasoning Reward Model
Evaluation Results
| Method | Links | |
|---|---|---|
| Expert Reasoning Reward ModelReward Model Backbone=Llama3.1-8B, Reward Model Training Distribution (Source Task)=MMLU-PRO, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 16.4 | |
| Expert Reasoning Reward ModelReward Model Backbone=Qwen3-4B, Reward Model Training Distribution (Source Task)=MMLU-PRO, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 9.5 | |
| Expert Reasoning Reward ModelReward Model Backbone=Llama3.1-8B, Reward Model Training Distribution (Source Task)=MEDREASON, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 7.8 | |
| Expert Reasoning Reward ModelReward Model Backbone=Qwen3-4B, Reward Model Training Distribution (Source Task)=MEDREASON, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 5.7 | |
| Expert Reasoning Reward ModelReward Model Backbone=Qwen3-4B, Reward Model Training Distribution (Source Task)=GSM8K, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 5.1 | |
| Expert Reasoning Reward ModelReward Model Backbone=Llama3.1-8B, Reward Model Training Distribution (Source Task)=GSM8K, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 4.6 |