ResearchBenchmarksReinforcement Learning on DMControl CartThreePoles v0 (train)Follow190.2Final Performance ScoreReflex142.568154.934167.3179.666May 22, 2026Evaluation ResultsMethodMethodLinksFinal Performance ScorePercentage ImprovementSteps to Baseline Final (Ratio)ReflexBase Algorithm=SACBase Algorithm=SAC2026.05190.290.26SACBase Algorithm=SACBase Algorithm=SAC2026.05174.8—0.64ReflexBase Algorithm=PPOBase Algorithm=PPO2026.05154.870.4PPOBase Algorithm=PPOBase Algorithm=PPO2026.05144.4—0.72