Preference Estimation on PE-FD=8 (test)
61.28Average Outcome RewardAREW– AS + BT
Evaluation Results
| Method | Links | |
|---|---|---|
| AREW– AS + BTTraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 61.28 | |
| AREW– AS ONLYTraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 55.61 | |
| VANILLATraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 55.21 | |
| AREW– AS + BTTraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 47.89 | |
| AREW– AS ONLYTraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 39.62 | |
| VANILLATraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 30.52 | |
| O4-MINITraining Protocol=DIRECT INFERENCE2026.03 | 8.42 | |
| LLAMA-3.1-8B-INST.Training Protocol=DIRECT INFERENCE2026.03 | 3.14 | |
| QWEN-2.5-7B-INST.Training Protocol=DIRECT INFERENCE2026.03 | 2.67 |