ResearchBenchmarksReinforcement Learning on InvertedDoublePendulum v3Follow9,360Average Final ReturnDACER6,134.966,972.237,809.58,646.77May 24, 2024Evaluation ResultsMethodMethodLinksAverage Final ReturnDACER2024.059,360DSAC2024.059,360SAC2024.059,360PPO2024.059,356TD32024.059,347DDPG2024.059,183TRPO2024.056,259