Preference Estimation on PE-FD=6 (test)
56.91Average Outcome RewardAREW– AS ONLY
Evaluation Results
| Method | Links | |
|---|---|---|
| AREW– AS ONLYTraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 56.91 | |
| AREW– AS + BTTraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 54.65 | |
| AREW– AS + BTTraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 44.47 | |
| AREW– AS ONLYTraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 42.1 | |
| VANILLATraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 32.03 | |
| O4-MINITraining Protocol=DIRECT INFERENCE2026.03 | 12.47 | |
| VANILLATraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 6 | |
| LLAMA-3.1-8B-INST.Training Protocol=DIRECT INFERENCE2026.03 | 5.7 | |
| QWEN-2.5-7B-INST.Training Protocol=DIRECT INFERENCE2026.03 | 4.2 |