ResearchBenchmarksReinforcement Learning on LunarLander classical control 1M stepsFollow267.19ReturnMCPO210.6764225.3482240.02254.6918Apr 20, 2022Evaluation ResultsMethodMethodLinksReturnMCPON=40N=402022.04267.19MCPON=10N=102022.04263.04MCPON=5N=52022.04262.23PPOclip epsilon=0.3clip epsilon=0.32022.04259.93KL Fixedbeta=0.1beta=0.12022.04256.75KL Adaptivedtarg=0.01dtarg=0.012022.04254.26MDPObeta0=2beta0=22022.04227.76VMPOalpha0=1alpha0=12022.04212.85