ResearchBenchmarksReinforcement Learning on DMControl CartpoleBalance v0 (train)Follow996.7Final ReturnReflex787.66841.93896.2950.47May 22, 2026Evaluation ResultsMethodMethodLinksFinal ReturnPercentage ImprovementSteps to Reach BaselineReflexBase Algorithm=SACBase Algorithm=SAC2026.05996.7—0.37SACBase Algorithm=SACBase Algorithm=SAC2026.05995.6—0.65ReflexBase Algorithm=PPOBase Algorithm=PPO2026.05893.2120.49PPOBase Algorithm=PPOBase Algorithm=PPO2026.05795.7—0.67