Preference Learning on Toy dataset Noise 30% (test)
0.739AccuracySSPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SSPOprior=0.5, n_L=50, n_U=10002025.10 | 0.739 | |
| SSPOprior=0.5, n_L=100, n_U=10002025.10 | 0.733 | |
| SSPOprior=0.5, n_L=10, n_U=10002025.10 | 0.698 | |
| DPOn_L=100, n_U=10002025.10 | 0.682 | |
| DPOn_L=10, n_U=10002025.10 | 0.673 | |
| SimPOn_L=10, n_U=10002025.10 | 0.668 | |
| DPOn_L=50, n_U=10002025.10 | 0.665 | |
| SimPOn_L=50, n_U=10002025.10 | 0.665 | |
| ORPOn_L=100, n_U=10002025.10 | 0.627 | |
| ORPOn_L=50, n_U=10002025.10 | 0.617 | |
| ORPOn_L=10, n_U=10002025.10 | 0.601 | |
| SimPOn_L=100, n_U=10002025.10 | 0.601 |