Controllable multi-objective generation on HH-RLHF Helpful vs Humor (test)
1.24HypervolumeBone Soup
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Bone SoupBackbone=LLama-2 7B2025.02 | 1.24 | 2.06 | 1 | 11 | 0.27 | 0.03 | |
| Rewarded SoupsBackbone=LLama-2 7B2025.02 | 1.12 | 1.89 | 1 | 11 | 0.24 | 0.02 | |
| MODBackbone=LLama-2 7B2025.02 | 1.09 | 1.85 | 1 | 11 | 0.24 | 0.02 | |
| Rewards-in-ContextBackbone=LLama-2 7B2025.02 | 0.66 | 1.52 | 0.8 | 6 | 0.25 | 0.07 |