Human Evaluation on LongBench Chat
14Helpfulness Win RateLongReward + DPO
Evaluation Results
| Method | Links | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LongReward + DPOModel=Llama-3.1-8B, Training Method=DPO, Reward Strategy=LongReward, Evaluation Protocol=Human Evaluation vs SFT Baseline2024.10 | 14 | 84 | 2 | 12 | 14 | 86 | 0 | 14 | 32 | 64 | 4 | 28 | 26 | 64 | 10 | 16 | 54 | 38 | 8 | 46 |