ResearchBenchmarksReinforcement Learning on LunarLander (Return and Sub-Policies Count)Follow166.3ReturnSVSP154.34157.445160.55163.655May 5, 2026Evaluation ResultsMethodMethodLinksReturnSub-Policies CountSVSPMax Tree Depth=3, Iter...Max Tree Depth=3, Iterations=32026.05166.310TD3Implementation=StableB...Implementation=StableBaselines32026.05161.8—VSP2026.05154.855.9