Long-context Factuality Evaluation on LongBench (Factuality Subset)
32.86Fact CountDPO w/ LongReward
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DPO w/ LongRewardBase Model=Llama-3.1-8B2024.10 | 32.86 | 92.85 | |
| DPO w/ LongRewardBase Model=GLM-4-9B2024.10 | 28.05 | 93.62 | |
| SFTBase Model=Llama-3.1-8B2024.10 | 21.76 | 91.94 | |
| SFTBase Model=GLM-4-9B2024.10 | 18.41 | 91.43 |