Pairwise Helpfulness Evaluation on HH-RLHF
64.7Win RateGGRO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GGROBase Model=LLaMA-3.1-8B-Instruct, Reward Model=Skywork-Reward-V2-LLaMA-3.1-8B, Baseline compared against=SEA2026.06 | 64.7 | 7.3 | 28 | |
| GGROBase Model=LLaMA-3.2-3B-Instruct, Reward Model=GRM-LLaMA-3.2-3B-rewardmodel-ft, Baseline compared against=SEA2026.06 | 60.7 | 9.3 | 30 | |
| GGROBase Model=LLaMA-3.1-8B-Instruct, Reward Model=Skywork-Reward-V2-LLaMA-3.1-8B, Baseline compared against=Vanilla LLM2026.06 | 57.3 | 12.7 | 30 | |
| GGROBase Model=LLaMA-3.1-8B-Instruct, Reward Model=Skywork-Reward-V2-LLaMA-3.1-8B, Baseline compared against=ARGS-G2026.06 | 52 | 12 | 36 | |
| GGROBase Model=LLaMA-3.1-8B-Instruct, Reward Model=Skywork-Reward-V2-LLaMA-3.1-8B, Baseline compared against=CARDS2026.06 | 48.7 | 6.7 | 44.7 | |
| GGROBase Model=LLaMA-3.1-8B-Instruct, Reward Model=Skywork-Reward-V2-LLaMA-3.1-8B, Baseline compared against=CBS2026.06 | 48 | 11.3 | 40.7 | |
| GGROBase Model=LLaMA-3.2-3B-Instruct, Reward Model=GRM-LLaMA-3.2-3B-rewardmodel-ft, Baseline compared against=Vanilla LLM2026.06 | 48 | 5.3 | 46.7 | |
| GGROBase Model=LLaMA-3.2-3B-Instruct, Reward Model=GRM-LLaMA-3.2-3B-rewardmodel-ft, Baseline compared against=CARDS2026.06 | 48 | 10 | 42 | |
| GGROBase Model=LLaMA-3.2-3B-Instruct, Reward Model=GRM-LLaMA-3.2-3B-rewardmodel-ft, Baseline compared against=BoN (N=64)2026.06 | 46.7 | 18.7 | 34.7 | |
| GGROBase Model=LLaMA-3.1-8B-Instruct, Reward Model=Skywork-Reward-V2-LLaMA-3.1-8B, Baseline compared against=RS2026.06 | 45.3 | 14 | 40.7 | |
| GGROBase Model=LLaMA-3.1-8B-Instruct, Reward Model=Skywork-Reward-V2-LLaMA-3.1-8B, Baseline compared against=BoN (N=64)2026.06 | 45.3 | 10 | 44.7 | |
| GGROBase Model=LLaMA-3.2-3B-Instruct, Reward Model=GRM-LLaMA-3.2-3B-rewardmodel-ft, Baseline compared against=ARGS-G2026.06 | 45.3 | 14 | 40.7 | |
| GGROBase Model=LLaMA-3.2-3B-Instruct, Reward Model=GRM-LLaMA-3.2-3B-rewardmodel-ft, Baseline compared against=CBS2026.06 | 45.3 | 14.7 | 40 | |
| GGROBase Model=LLaMA-3.2-3B-Instruct, Reward Model=GRM-LLaMA-3.2-3B-rewardmodel-ft, Baseline compared against=RS2026.06 | 41.3 | 15.3 | 43.3 |