Mathematical Reasoning on GSM8K (Best-of-16 Δ)
13Best-of-16 DeltaExpert Reasoning Reward Model
Evaluation Results
| Method | Links | |
|---|---|---|
| Expert Reasoning Reward ModelReward Model Backbone=Qwen3-4B, Reward Model Training Distribution (Source Task)=GSM8K, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 13 | |
| Expert Reasoning Reward ModelReward Model Backbone=Llama3.1-8B, Reward Model Training Distribution (Source Task)=GSM8K, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 12.1 | |
| Expert Reasoning Reward ModelReward Model Backbone=Llama3.1-8B, Reward Model Training Distribution (Source Task)=MMLU-PRO, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 11.3 | |
| Expert Reasoning Reward ModelReward Model Backbone=Qwen3-4B, Reward Model Training Distribution (Source Task)=MMLU-PRO, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 8.8 | |
| Expert Reasoning Reward ModelReward Model Backbone=Llama3.1-8B, Reward Model Training Distribution (Source Task)=MEDREASON, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 7.6 | |
| Expert Reasoning Reward ModelReward Model Backbone=Qwen3-4B, Reward Model Training Distribution (Source Task)=MEDREASON, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 2.8 |