ResearchBenchmarksSafe Reinforcement Learning on Linear Mixture MDP inhomogeneous, episodic B-boundedFollow2Regret[3]1.91.9522.05Mar 29, 2026Evaluation ResultsMethodMethodLinksRegretConstraint Violations[3]Reward=FixedReward=Fixed2026.0322PD-POWERSReward=AdversarialReward=Adversarial2026.0322