General Knowledge Reasoning on MMLU-PRO (Best-of-16 Δ)
9.3Best-of-16 DeltaExpert Reasoning Reward Model
Evaluation Results
| Method | Links | |
|---|---|---|
| Expert Reasoning Reward ModelReward Model Backbone=Qwen3-4B, Reward Model Training Distribution (Source Task)=GSM8K, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 9.3 | |
| Expert Reasoning Reward ModelReward Model Backbone=Llama3.1-8B, Reward Model Training Distribution (Source Task)=MMLU-PRO, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 4.4 | |
| Expert Reasoning Reward ModelReward Model Backbone=Llama3.1-8B, Reward Model Training Distribution (Source Task)=MEDREASON, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 3.7 | |
| Expert Reasoning Reward ModelReward Model Backbone=Llama3.1-8B, Reward Model Training Distribution (Source Task)=GSM8K, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 3 | |
| Expert Reasoning Reward ModelReward Model Backbone=Qwen3-4B, Reward Model Training Distribution (Source Task)=MMLU-PRO, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 2 | |
| Expert Reasoning Reward ModelReward Model Backbone=Qwen3-4B, Reward Model Training Distribution (Source Task)=MEDREASON, SFT Generation Model=Qwen2.5-7B, Reward Granularity=interval2025.10 | 0.2 |