ResearchBenchmarksReinforcement Learning on Pendulum (Return, Steps, and Stuck Rate)Follow80,240Steps (Mean)PPO-605.4420,383.2841,37262,360.72Jun 2, 2025Evaluation ResultsMethodMethodLinksSteps (Mean)Steps (95% CI)Return (Mean)Return (95% CI)Stuck RatePPOSafeguard=BPSafeguard=BP2025.0680,24078,880-10-100PPOSafeguard=RMSafeguard=RM2025.0676,16072,080-12-120SHACSafeguard=RMSafeguard=RM2025.0627,39220,992-8-80SHACSafeguard=BPSafeguard=BP2025.0623,36018,560-8-820SACSafeguard=BPSafeguard=BP2025.062,5042,504-1,083-1,1030SACSafeguard=RMSafeguard=RM2025.062,5042,504-424-4650