Response Quality Evaluation on AlpacaEval ELOM gpt4 (test)
1,629ELOM(ai, ai+1)
Evaluation Results
| Method | Links | |
|---|---|---|
| (ai, ai+1)training_pairs=1303, strategy=Stepwise preference pairs2025.12 | 1,629 | |
| (a0, a*)training_pairs=277, strategy=Cumulative rewriting preference2025.12 | 1,617 | |
| (ai, ai+1)dstraining_pairs=277, strategy=Stepwise preference pairs (downsampled)2025.12 | 1,602 | |
| (a0, a1)training_pairs=277, strategy=Single-step edit preference2025.12 | 1,435 | |
| (a, b)training_pairs=277, strategy=Standard A/B preference ranking2025.12 | 1,376 | |
| basetraining_pairs=02025.12 | 1,355 | |
| a* SFTtraining_pairs=277, strategy=Supervised Fine-Tuning2025.12 | 1,353 |