ResearchBenchmarksReinforcement Learning on MuJoCo InvertedPendulum unseen environments (test)Follow926.51Average ReturnGERS511.3212619.1106726.9834.6894Jun 15, 2026Evaluation ResultsMethodMethodLinksAverage ReturnGERS2026.06926.51DRTraining Timesteps=5 x...Training Timesteps=5 x 10^72026.06906.99BasePPOTraining Timesteps=3 x...Training Timesteps=3 x 10^72026.06527.29