ResearchBenchmarksOffline-to-Online Reinforcement Learning on Walker2d D4RLFollow12.43Walker2d Return (Random)ROAD8.57169.573310.57511.5767May 14, 2026Evaluation ResultsMethodMethodLinksWalker2d Return (Random)Walker2d Return (Medium Replay)Walker2d Return (Medium)Walker2d Return (Medium Expert)Walker2d Return (Expert)ROADMixing Ratio Strategy=...Mixing Ratio Strategy=ROAD, Algorithm=IQL2026.0512.4378.1560.1783.688.060.1Mixing Ratio Strategy=...Mixing Ratio Strategy=Fixed (0.1), Algorithm=IQL2026.058.7234.5659.0776.1589.75