ResearchBenchmarksReinforcement Learning on MuJoCo Hopper unseen (test)Follow1,673.58Average ReturnGERS579.8848863.82491,147.7651,431.7051Jun 15, 2026Evaluation ResultsMethodMethodLinksAverage ReturnGERS2026.061,673.58DRTraining Timesteps=5 x...Training Timesteps=5 x 10^72026.061,260.41BasePPOTraining Timesteps=3 x...Training Timesteps=3 x 10^72026.06621.95