ResearchBenchmarksReinforcement Learning on bipedalwalker NoisyFollow32,301,685.83AUC@TPPO27,728,362.769228,915,667.794630,102,972.8231,290,277.8454Feb 6, 2026Evaluation ResultsMethodMethodLinksAUC@TFinal Score@TDelta % AUC@TDelta % Final@TPPO2026.0232,301,685.8381.24——HFPS2026.0227,904,259.81103.64-13.627.6