ResearchBenchmarksOffline Reinforcement Learning on DMControl walker-walk (random)Follow92.81Normalized ScoreCQL + S2P-4.003621.130746.26571.3993Sep 30, 2022Evaluation ResultsMethodMethodLinksNormalized ScoreCQL + S2PS2P Augmentation=trueS2P Augmentation=true2022.0992.81SLAC-off + S2PS2P Augmentation=trueS2P Augmentation=true2022.0985.57CQLS2P Augmentation=falseS2P Augmentation=false2022.0984.87SLAC-offS2P Augmentation=falseS2P Augmentation=false2022.0970.04IQL + S2PS2P Augmentation=trueS2P Augmentation=true2022.094.03IQLS2P Augmentation=falseS2P Augmentation=false2022.09-0.28