ResearchBenchmarksReinforcement Learning on FrozenLake 6x6Follow98RewardPACT44.9658.7372.586.27Jun 15, 2026Evaluation ResultsMethodMethodLinksRewardEpisode LengthLM Usage (%)PACTLM size=2B-parameterLM size=2B-parameter2026.06981027.9PPO2026.06939.5—ASK2026.068914.427.1SAYCAN2026.06889.360.1SLM2026.064781.2100