Response Generation on HH dataset
-0.96RewardAlpaca
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AlpacaSetting=RRHF_SP2023.04 | -0.96 | 14.41 | |
| AlpacaSetting=Best-of-42023.04 | -0.97 | — | |
| AlpacaSetting=PPO2023.04 | -1.03 | 13.84 | |
| AlpacaSetting=RRHF_DP2023.04 | -1.03 | 14.75 | |
| AlpacaSetting=Direct evaluation (null)2023.04 | -1.18 | 14.34 | |
| Alpaca-sftSetting=RRHF_DP2023.04 | -1.19 | 18.1 | |
| Good responsesSetting=Direct evaluation (null)2023.04 | -1.24 | 21.46 | |
| Alpaca-sftSetting=PPO2023.04 | -1.25 | 19.1 | |
| LLaMASetting=RRHF_DP2023.04 | -1.34 | 67.12 | |
| Alpaca-sftSetting=Direct evaluation (null)2023.04 | -1.46 | 18.98 | |
| Bad responsesSetting=Direct evaluation (null)2023.04 | -1.48 | 121.29 | |
| LLaMASetting=PPO2023.04 | -1.62 | 42.53 | |
| LLaMASetting=Direct evaluation (null)2023.04 | -1.89 | 20.78 |