ResearchBenchmarksReinforcement Learning on Swimmer (Mean best reward)Follow294.57Mean Best RewardR2PO58.8228120.0264181.23242.4336May 8, 2026Evaluation ResultsMethodMethodLinksMean Best RewardR2PONumber of independent...Number of independent runs=102026.05294.57ProPS+Number of independent...Number of independent runs=102026.05274.86ProPSNumber of independent...Number of independent runs=102026.05208.52TRPOSource=Best SB3, Numbe...Source=Best SB3, Number of independent runs=102026.0567.89