Loading the SOTA2 catalog…
Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning · SOTA2 Research