ResearchBenchmarksSafe Reinforcement Learning on SafetyPointPush2 v0Follow0.6Mean RewardPPO-LAG-0.8248-0.4549-0.0850.2849Apr 3, 2026Evaluation ResultsMethodMethodLinksMean RewardStd RewardMean CostStd CostPPO-LAGTime Mean (s)=4.09Time Mean (s)=4.092026.040.61.5831.3458.17PPOTime Mean (s)=3.78Time Mean (s)=3.782026.040.413.1159.86120.18TRPOTime Mean (s)=4.03Time Mean (s)=4.032026.040.22.5106.88216.19PPO-FABTime Mean (s)=3.71Time Mean (s)=3.712026.04-0.070.527.737.51TRPO-LAGTime Mean (s)=4.05Time Mean (s)=4.052026.04-0.775.5128.2267.21