ResearchBenchmarksSafe Reinforcement Learning on Linear MDPFollow3Regret[4]2.852.92533.075Mar 29, 2026Evaluation ResultsMethodMethodLinksRegretConstraint Violation[4]Reward=FixedReward=Fixed2026.0333[8]Reward=AdversarialReward=Adversarial2026.0333