Loading the SOTA2 catalog…
Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play · SOTA2 Research