ResearchBenchmarksOffline Goal-Conditioned Reinforcement Learning on puzzle 4x5Follow9,600Success RateDQC-3842,2084,8007,392Dec 11, 2025Evaluation ResultsMethodMethodLinksSuccess RateDQCMethod=Decoupled Q-chu...Method=Decoupled Q-chunking2025.129,600NSBackup=n-step return b...Backup=n-step return backup2025.129,300DQC-naïveExecution=partial acti...Execution=partial action chunk2025.123,300IQL2025.122,000QCStrategy=Q-chunkingStrategy=Q-chunking2025.122,000OSBackup=1-step TD-backupBackup=1-step TD-backup2025.121,900SHARSA2025.12100FBC2025.120HFBC2025.120HIQL2025.120