ResearchBenchmarksReinforcement Learning on Spring PendulumFollow182.4221Episode RewardRPO-SAC-6.40258842.61920691.641140.662794Oct 14, 2023Evaluation ResultsMethodMethodLinksEpisode RewardMax Instantaneous Inequality ViolationMax Instantaneous Equality ViolationMax Episode Inequality ViolationMax Episode Equality ViolationRPO-SAC2023.10182.42210000RPO-DDPG2023.10175.15580000SAC-Ltype=abridged versiontype=abridged version2023.10149.676200.007800.0837DDPG-Ltype=abridged versiontype=abridged version2023.1076.438300.380501.0905CPO2023.1015.468700.727401.9064Safety Layer2023.101.11556.09753.913436.954525.2101CUP2023.100.859909.5898016.3114