ResearchBenchmarksReinforcement Learning on MuJoCo HalfCheetah unseen environments (test)Follow4,956.37Average ReturnDR2,467.47323,113.62913,759.7854,405.9409Jun 15, 2026Evaluation ResultsMethodMethodLinksAverage ReturnDRTraining Timesteps=5 x...Training Timesteps=5 x 10^72026.064,956.37GERS2026.063,992.22BasePPOTraining Timesteps=3 x...Training Timesteps=3 x 10^72026.062,563.2