ResearchBenchmarksOffline Reinforcement Learning on D4RL Mujoco Halfcheetah-Medium v2Follow42.3Normalized ScoreMOPO39.740.37541.0541.725Nov 2, 2023Evaluation ResultsMethodMethodLinksNormalized ScoreMOPOReward Access=YesReward Access=Yes2023.1142.3MOReLReward Access=YesReward Access=Yes2023.1142.1TAILONetwork Size (Actor)=[...Network Size (Actor)=[256, 256], Activation Function=ReLU, Learning Rate (Actor)=0.0001, Batch Size (Actor)=8192, Optimizer=Adam, Reward Access=No2023.1139.8