Preference Learning on Toy dataset Noise 10% (test)
93.1AccuracySSPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SSPOprior=0.5, n_L=100, n_U=10002025.10 | 93.1 | |
| SSPOprior=0.5, n_L=10, n_U=10002025.10 | 84 | |
| SSPOprior=0.5, n_L=50, n_U=10002025.10 | 81.2 | |
| DPOn_L=100, n_U=10002025.10 | 78.3 | |
| SimPOn_L=100, n_U=10002025.10 | 77 | |
| SimPOn_L=10, n_U=10002025.10 | 74.4 | |
| DPOn_L=50, n_U=10002025.10 | 74.2 | |
| SimPOn_L=50, n_U=10002025.10 | 73.7 | |
| DPOn_L=10, n_U=10002025.10 | 69.5 | |
| ORPOn_L=100, n_U=10002025.10 | 68.2 | |
| ORPOn_L=50, n_U=10002025.10 | 64.6 | |
| ORPOn_L=10, n_U=10002025.10 | 59.5 |