Loading the SOTA2 catalog…
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models · SOTA2 Research