ResearchBenchmarksOffline Reinforcement Learning on D4RL Mujoco v0 (various)Follow35.4HalfCheetah Return (Random)MOPO0.8729.83618.827.764Jul 12, 2021Evaluation ResultsMethodMethodLinksHalfCheetah Return (Random)Hopper Return (Random)Walker2d Return (Random)HalfCheetah Return (Medium)Walker2d Return (Medium)Hopper Return (Medium)HalfCheetah Return (Mixed)Hopper Return (Mixed)Walker2d Return (Mixed)HalfCheetah Return (Medium-Expert)Walker2d Return (Medium-Expert)Hopper Return (Medium-Expert)MOPO2021.0735.411.713.642.317.82853.167.53963.344.623.7CQL2021.0735.410.8744.479.25846.248.626.762.498.7111CODACvariant=risk-neutralvariant=risk-neutral2021.0734.61118.746.38270.844.1100.233.270.4106112ORAAC2021.0713.59.83.24127.31.483016.3282428.218.2BCQ2021.072.210.64.940.753.154.538.233.11564.757.5110.9