Loading the SOTA2 catalog…
When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL · SOTA2 Research