ResearchBenchmarksOffline Reinforcement Learning on OGBench long-horizon reasoning tasksFollow56Cube Triple Play Success RateUHM-1.213.6528.543.35May 15, 2026Evaluation ResultsMethodMethodLinksCube Triple Play Success RateCube Quadruple Play Success RatePuzzle 4x5 Success RatePuzzle 4x6 Success RateHumanoid Maze Navigation Success RateAverage Success RateUHM2026.05561616111022GHM2026.054412175416MBTD(λ)2026.051205155ReBRAC†2026.054071125DTD(λ)2026.05101454613