Human Preference Alignment on HH (test)
3.8764RewardTRE-P
Evaluation Results
| Method | Links | |
|---|---|---|
| TRE-PBackbone=Qwen2.5-1.5B-Instruct2026.02 | 3.8764 | |
| TRE-KBackbone=Qwen2.5-1.5B-Instruct2026.02 | 3.8209 | |
| KL-CovBackbone=Qwen2.5-1.5B-Instruct2026.02 | 3.3931 | |
| Forking-TokensBackbone=Qwen2.5-1.5B-Instruct2026.02 | 3.3184 | |
| Vanilla (PPO)Backbone=Qwen2.5-1.5B-Instruct2026.02 | 3.24 | |
| EntBackbone=Qwen2.5-1.5B-Instruct2026.02 | 3.1913 | |
| TRE-PBackbone=Qwen2.5-7B-Instruct2026.02 | 3.0331 | |
| TRE-KBackbone=Qwen2.5-7B-Instruct2026.02 | 2.9715 | |
| KL-CovBackbone=Qwen2.5-7B-Instruct2026.02 | 2.9529 | |
| Vanilla (PPO)Backbone=Qwen2.5-7B-Instruct2026.02 | 2.8839 | |
| EntBackbone=Qwen2.5-7B-Instruct2026.02 | 2.8718 | |
| Forking-TokensBackbone=Qwen2.5-7B-Instruct2026.02 | 2.849 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.02 | 2.0749 | |
| BaseBackbone=Qwen2.5-1.5B-Instruct2026.02 | 0.0036 |