ResearchBenchmarksOffline-to-Online Reinforcement Learning on HalfCheetah D4RL SuiteFollow49.37Return (HalfCheetah Random)ROAD41.164443.294745.42547.5553May 14, 2026Evaluation ResultsMethodMethodLinksReturn (HalfCheetah Random)Return (HalfCheetah Medium-Replay)Return (HalfCheetah Medium)Return (HalfCheetah Medium-Expert)Return (HalfCheetah Expert)ROADMixing Ratio Strategy=...Mixing Ratio Strategy=ROAD, Algorithm=IQL2026.0549.3755.8274.5795.0696.86BRMixing Ratio Strategy=...Mixing Ratio Strategy=BR, Algorithm=IQL2026.0547.4349.2872.4993.3494.910.0Mixing Ratio Strategy=...Mixing Ratio Strategy=Fixed (0.0), Algorithm=IQL2026.0541.4850.769.6163.7578.28