Preference Estimation on PE-GS=2 (test)
54.67Average Outcome RewardAREW– AS + BT
Evaluation Results
| Method | Links | |
|---|---|---|
| AREW– AS + BTTraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 54.67 | |
| AREW– AS + BTTraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 49.33 | |
| AREW– AS ONLYTraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 49 | |
| AREW– AS ONLYTraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 46 | |
| VANILLATraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 27.33 | |
| VANILLATraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 24 | |
| LLAMA-3.1-8B-INST.Training Protocol=DIRECT INFERENCE2026.03 | 18 | |
| O4-MINITraining Protocol=DIRECT INFERENCE2026.03 | 17.11 | |
| QWEN-2.5-7B-INST.Training Protocol=DIRECT INFERENCE2026.03 | 15 |