ResearchBenchmarksSafe Reinforcement Learning on SafetyPointGoal2 v0Follow15.58Mean RewardTRPO-1.7882.7217.2311.739Apr 3, 2026Evaluation ResultsMethodMethodLinksMean RewardStd Dev of RewardMean CostStd Dev of CostTRPOTime Mean (s)=2.59Time Mean (s)=2.592026.0415.5810.31164.1488.43PPOTime Mean (s)=2.47Time Mean (s)=2.472026.0413.2614.05167.4687.06TRPO-LAGTime Mean (s)=2.78Time Mean (s)=2.782026.042.378.4689.04187.67PPO-LAGTime Mean (s)=2.40Time Mean (s)=2.402026.042.245.154.164.5PPO-FABTime Mean (s)=2.75Time Mean (s)=2.752026.04-1.121.1124.3237.84