ResearchBenchmarksReinforcement Learning on Delayed MuJoCo HalfCheetah v2 (test)Follow8,451.2Average ReturnDE-MME3,905.84885,085.89196,265.9357,445.9781Jun 19, 2021Evaluation ResultsMethodMethodLinksAverage ReturnDE-MME2021.068,451.2MaxEnt(State)2021.067,907.98DAC2021.067,594.7RND2021.067,429.94MME2021.067,299.28SAC-Div2021.064,080.67