Loading the SOTA2 catalog…
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training · SOTA2 Research