ResearchBenchmarksReinforcement Learning on DMControl WalkerRun v0 (train)Follow809.6Final PerformanceReflex121.12299.86478.6657.34May 22, 2026Evaluation ResultsMethodMethodLinksFinal PerformancePercentage ImprovementSteps to Final BaselineReflexBase Algorithm=SACBase Algorithm=SAC2026.05809.670.11SACBase Algorithm=SACBase Algorithm=SAC2026.05753.6—1ReflexBase Algorithm=PPOBase Algorithm=PPO2026.05182.5240.63PPOBase Algorithm=PPOBase Algorithm=PPO2026.05147.6—1