Constraint Following on CELLO
65.7AccuracyREWARDAGENT_LLAMA-OP
Evaluation Results
| Method | Links | |
|---|---|---|
| REWARDAGENT_LLAMA-OPDPO Training Data=On-Policy, Preference Pair Construction=REWARDAGENT2025.02 | 65.7 | |
| Original UFDPO Training Data=Original UltraFeedback2025.02 | 62 | |
| ArmoRM-UFDPO Training Data=UltraFeedback, Preference Pair Construction=ArmoRM2025.02 | 60.8 | |
| REWARDAGENT_LLAMA-UFDPO Training Data=UltraFeedback, Preference Pair Construction=REWARDAGENT2025.02 | 60.1 | |
| ArmoRM-OPDPO Training Data=On-Policy, Preference Pair Construction=ArmoRM2025.02 | 58.1 | |
| Zephyr-7b-sft-fullDPO Training Data=None (Base Model)2025.02 | 51.5 |