ResearchBenchmarksReinforcement Learning on Delayed MuJoCo Ant v2 (test)Follow4,851.64Max Average ReturnDE-MME1,008.80882,006.46693,004.1254,001.7831Jun 19, 2021Evaluation ResultsMethodMethodLinksMax Average ReturnDE-MME2021.064,851.64MME2021.064,664.04DAC2021.064,243.19SAC-Div2021.063,978.34RND2021.061,361.36MaxEnt(State)2021.061,156.61