ResearchBenchmarksReinforcement Learning on FrozenLake 6x6 (With Slipperiness)Follow93RewardPACT45.1657.587082.42Jun 15, 2026Evaluation ResultsMethodMethodLinksRewardEpisode LengthLM UsagePACTLM size=2B-parameterLM size=2B-parameter2026.06939.558.4PPO2026.06649.6—ASK2026.066310.726.7SAYCAN2026.06539.159.7SLM2026.064715.5100