ResearchBenchmarksReinforcement Learning on Gymnasium IDPendulum v4 (train)Follow9,347.1Final ScoreReflex5,755.466,687.9057,620.358,552.795May 22, 2026Evaluation ResultsMethodMethodLinksFinal ScorePercentage ImprovementSteps to Baseline RatioReflexBase Algorithm=SACBase Algorithm=SAC2026.059,347.1—0.36SACBase Algorithm=SACBase Algorithm=SAC2026.059,343.1—0.4ReflexBase Algorithm=PPOBase Algorithm=PPO2026.056,174.650.54PPOBase Algorithm=PPOBase Algorithm=PPO2026.055,893.6—0.79