ResearchBenchmarksReinforcement Learning on bipedalwalker StickyFollow42,687,915.83AUC@TPPO30,769,036.1333,863,360.667536,957,685.20540,052,009.7425Feb 6, 2026Evaluation ResultsMethodMethodLinksAUC@TFinal@TDelta % (AUC@T)Delta % (Final@T)PPO2026.0242,687,915.83101.74——HFPS2026.0231,227,454.58132.5-26.830.2