ResearchBenchmarksOffline Reinforcement Learning on D4RL walker2d medium-expert (Average reward)Follow112.7Average RewardIDQL107.292108.696110.1111.504May 31, 2024Evaluation ResultsMethodMethodLinksAverage RewardIDQL2024.05112.7QGPO2024.05110.7D-QL2024.05109.7IQL2024.05109.6RTB2024.05109.52CQL2024.05108.8DD2024.05108.8D2024.05108.4BC2024.05107.5