Loading the SOTA2 catalog…
Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback · SOTA2 Research