ResearchBenchmarksReinforcement Learning on BWalker classical control 5M stepsFollow266.26ReturnMCPO225.2216235.8758246.53257.1842Apr 20, 2022Evaluation ResultsMethodMethodLinksReturnMCPON=10N=102022.04266.26MCPON=5N=52022.04265.8KL Fixedbeta=0.1beta=0.12022.04263.56PPOclip epsilon=0.3clip epsilon=0.32022.04260.51MCPON=40N=402022.04249.51KL Adaptivedtarg=0.01dtarg=0.012022.04247.7VMPOalpha0=1alpha0=12022.04238.82MDPObeta0=2beta0=22022.04226.8