ResearchBenchmarksOffline-to-online Reinforcement Learning on OGBench puzzle-3x3 5 tasksFollow100Online Success RateRLPD16.838.46081.6May 7, 2026Evaluation ResultsMethodMethodLinksOnline Success RateOffline Success RateRLPDTD Type=1-step TDTD Type=1-step TD2026.05100—FQLTD Type=1-step TDTD Type=1-step TD2026.0510099FQL-nTD Type=n-step TDTD Type=n-step TD2026.0510099QC-FQLTD Type=Q-chunkingTD Type=Q-chunking2026.0510064QCTD Type=Q-chunkingTD Type=Q-chunking2026.05100100AQCTD Type=OursTD Type=Ours2026.05100100DQCTD Type=Q-chunkingTD Type=Q-chunking2026.059786IQLTD Type=1-step TDTD Type=1-step TD2026.05200