ResearchBenchmarksLocomotion on Walker2d v3Follow5,191.8Average ReturnQVPO3,2473,751.94,256.84,761.7May 25, 2024Evaluation ResultsMethodMethodLinksAverage ReturnQVPOtraining iterations=1e6training iterations=1e62024.055,191.8SACtraining iterations=1e6training iterations=1e62024.054,888.1DIPOtraining iterations=1e6training iterations=1e62024.054,681.7PPOtraining iterations=1e6training iterations=1e62024.053,751.5QSMtraining iterations=1e6training iterations=1e62024.053,613.4TD3training iterations=1e6training iterations=1e62024.053,513.9SPOtraining iterations=1e6training iterations=1e62024.053,321.8