ResearchBenchmarksReinforcement Learning on Humanoid tight heterogeneous constraints v5 (test)Follow5,498ReturnDD-SRad2,140.883,012.443,8844,755.56May 5, 2026Evaluation ResultsMethodMethodLinksReturnCVUtilizationDD-SRadBackbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.055,4983.720.3D-TanhBackbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.055,3136.418.4BoxPre+Backbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.055,2912.317.9Post(QP)Backbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.054,4202.646.5SRad-QPBackbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.053,8108.71.5SRad-StrictBackbone=TD3, Seeds=5Backbone=TD3, Seeds=52026.052,27049.65.3