ResearchBenchmarksReinforcement Learning on Hopper tight heterogeneous constraints v5 (test)Follow3,312ReturnDD-SRad750.481,415.492,080.52,745.51May 5, 2026Evaluation ResultsMethodMethodLinksReturnCoefficient of VariationUtilizationDD-SRadBackbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.053,31211.646.2BoxPre+Backbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.053,256630.3D-TanhBackbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.052,7128.449.6SRad-StrictBackbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.052,39413.416.6SRad-QPBackbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.051,02013.633.3Post(QP)Backbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.0584929.648.7