ResearchBenchmarksReinforcement Learning on DI-double-gates+Follow13Mean RewardDMPS-18.616-10.408-2.26.008May 22, 2024Evaluation ResultsMethodMethodLinksMean RewardStandard DeviationDMPS2024.05130.6MPS2024.05-0.90.1PPO-Lag2024.05-2.80.4TD32024.05-4.11.1CPO2024.05-17.412.8