ResearchBenchmarksOffline-to-online Reinforcement Learning on D4RL walker2dFollow650.5RegretSMAC486.9361,590.9932,695.053,799.107Feb 19, 2026Evaluation ResultsMethodMethodLinksRegretSMACOffline Algorithm=SMAC...Offline Algorithm=SMAC, Fine-tuning algorithm=SAC2026.02650.5CalQL/CQLOffline Algorithm=CalQ...Offline Algorithm=CalQL/CQL, Fine-tuning algorithm=SAC2026.021,553.7IQLOffline Algorithm=IQL,...Offline Algorithm=IQL, Fine-tuning algorithm=SAC2026.021,801.2TD3+BCOffline Algorithm=TD3+...Offline Algorithm=TD3+BC, Fine-tuning algorithm=SAC2026.024,739.6