ResearchBenchmarksReinforcement Learning on MuJoCo Humanoid v2 (test)Follow9,080.54Max Avg ReturnMME4,847.92725,946.77867,045.638,144.4814Jun 19, 2021Evaluation ResultsMethodMethodLinksMax Avg ReturnMME2021.069,080.54DE-MME2021.068,607.75SAC2021.066,760.81PPO2021.066,153.54TRPO2021.065,730.74SQL2021.065,010.72