ResearchBenchmarksReinforcement Learning on Pendulum PD-C (test)Follow854Cumulative RewardSA-DT-1,430.88-837.69-244.5348.69Mar 11, 2026Evaluation ResultsMethodMethodLinksCumulative RewardSA-DTDepth (d)=8, Number of...Depth (d)=8, Number of random trials=252026.03854SYMPOLNumber of random trial...Number of random trials=252026.03323SDTNumber of random trial...Number of random trials=252026.03310MLPNumber of random trial...Number of random trials=252026.03191SA-DTDepth (d)=5, Number of...Depth (d)=5, Number of random trials=252026.03-1,251D-SDTNumber of random trial...Number of random trials=252026.03-1,343