Loading the SOTA2 catalog…
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases · SOTA2 Research