ResearchBenchmarksReinforcement Learning on single-gate Double Integrator dynamicsFollow11.6Mean ReturnDMPS-20.848-12.424-44.424May 22, 2024Evaluation ResultsMethodMethodLinksMean ReturnReturn Std DevDMPS2024.0511.60MPS2024.0511.60DMPS2024.0511.50.1MPS2024.0511.40.1PPO-Lag2024.05-21.1TD32024.05-2.10.2PPO-Lag2024.05-2.40.2CPO2024.05-2.50.3TD32024.05-3.10.5CPO2024.05-19.617