ResearchBenchmarksOffline Goal-Conditioned Reinforcement Learning on puzzle-4x6-1BFollow9,100Success RateNS-2602,1704,6007,030Dec 11, 2025Evaluation ResultsMethodMethodLinksSuccess RateNSBackup=n-step return b...Backup=n-step return backup2025.129,100DQCMethod=Decoupled Q-chu...Method=Decoupled Q-chunking2025.128,300SHARSA2025.126,400DQC-naïveExecution=partial acti...Execution=partial action chunk2025.123,300QCStrategy=Q-chunkingStrategy=Q-chunking2025.122,800OSBackup=1-step TD-backupBackup=1-step TD-backup2025.121,900HIQL2025.12900IQL2025.12600HFBC2025.12400FBC2025.12100