ResearchBenchmarksReinforcement Learning on FrozenLake (Mean best reward)Follow93Mean Best RewardR2PO8.7630.6352.574.37May 8, 2026Evaluation ResultsMethodMethodLinksMean Best RewardR2PONumber of independent...Number of independent runs=102026.0593ProPS+Number of independent...Number of independent runs=102026.0590ProPSNumber of independent...Number of independent runs=102026.0524TRPOSource=Best SB3, Numbe...Source=Best SB3, Number of independent runs=102026.0512