ResearchBenchmarksReinforcement Learning on Pendulum classical control (1M steps)Follow-133.42ReturnMCPO-609.6256-485.9953-362.365-238.7347Apr 20, 2022Evaluation ResultsMethodMethodLinksReturnMCPON=5N=52022.04-133.42MDPObeta0=2beta0=22022.04-135.52MCPON=40N=402022.04-135.57VMPOalpha0=1alpha0=12022.04-139.5MCPON=10N=102022.04-146.88KL Adaptivedtarg=0.01dtarg=0.012022.04-147.52KL Fixedbeta=0.1beta=0.12022.04-464.29PPOclip epsilon=0.3clip epsilon=0.32022.04-591.31