ResearchBenchmarksOffline Reinforcement Learning on D4RL MuJoCo (medium and med-expert configurations)Follow79.2Walker2d (medium)CQL14.92831.61448.364.986Jun 7, 2021Evaluation ResultsMethodMethodLinksWalker2d (medium)Hopper (medium)HalfCheetah (medium)Walker2d (med-expert)Hopper (med-expert)HalfCheetah (med-expert)CQLrandom_seeds=3random_seeds=32021.0679.25844.498.7111104.8BRAC-prandom_seeds=3random_seeds=32021.0677.532.743.876.91.944.2ICQrandom_seeds=3random_seeds=32021.0671.855.642.598.9109110.3BCrandom_seeds=3random_seeds=32021.0666.64936.166.8111.935.8BCQrandom_seeds=3random_seeds=32021.0653.154.540.757.5110.964.7AWRrandom_seeds=3random_seeds=32021.0617.435.937.453.827.152.7