ResearchBenchmarksReinforcement Learning on LunarLander (LL) (test)Follow241Average Undiscounted RewardMLP-239.48-114.7410134.74Mar 11, 2026Evaluation ResultsMethodMethodLinksAverage Undiscounted RewardMLPNumber of random trial...Number of random trials=252026.03241SYMPOLNumber of random trial...Number of random trials=252026.0357SDTNumber of random trial...Number of random trials=252026.03-124SA-DTDepth (d)=8, Number of...Depth (d)=8, Number of random trials=252026.03-150SA-DTDepth (d)=5, Number of...Depth (d)=5, Number of random trials=252026.03-197D-SDTNumber of random trial...Number of random trials=252026.03-221