Preference Estimation on PE GS=3 (test)
80.33Average Outcome RewardAREW– AS + BT
Evaluation Results
| Method | Links | |
|---|---|---|
| AREW– AS + BTTraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 80.33 | |
| AREW– AS + BTTraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 77.67 | |
| AREW– AS ONLYTraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 73 | |
| AREW– AS ONLYTraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 32 | |
| O4-MINITraining Protocol=DIRECT INFERENCE2026.03 | 21.15 | |
| VANILLATraining Protocol=PPO-TRAINED, Backbone=QWEN-2.5-7B-INST.2026.03 | 18.33 | |
| LLAMA-3.1-8B-INST.Training Protocol=DIRECT INFERENCE2026.03 | 12.33 | |
| VANILLATraining Protocol=PPO-TRAINED, Backbone=LLAMA-3.1-8B-INST.2026.03 | 11 | |
| QWEN-2.5-7B-INST.Training Protocol=DIRECT INFERENCE2026.03 | 10 |