ResearchBenchmarksReinforcement Learning on FrozenLake 8x8Follow1RewardPACT0.39680.55340.710.8666Jun 15, 2026Evaluation ResultsMethodMethodLinksRewardEpisode LengthLM UsagePACTLM size=2B-parameterLM size=2B-parameter2026.06115.581.2PPO2026.060.7912.4—ASK2026.060.7413.428.7SAYCAN2026.060.6211.673.1SLM2026.060.4235.4100