Preference Alignment on UltraFeedback (RM and GPT-4o-mini Evaluators)
71.25Win Rate (RM Evaluator)Vanilla Baseline
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Vanilla BaselinePreference Dimensions=2-dim2026.05 | 71.25 | 69.75 | 72.45 | |
| p-soup & Direct Fine-tuningPreference Dimensions=2-dim2026.05 | 65.5 | 45.37 | 57.31 | |
| Direct PromptingPreference Dimensions=2-dim2026.05 | 48.44 | 50.38 | 50.47 |