Reinforcement Learning on Humanoid v5 (delta=[0.8^6, 0.5^6, 0.2^5], kappa=4.0) (test)
5,620ReturnDD-SRad
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DD-SRadBackbone=SAC2026.05 | 5,620 | 0.038 | 0.489 | |
| DD-SRadBackbone=TD32026.05 | 5,498 | 0.037 | 0.203 | |
| D-TanhBackbone=TD32026.05 | 5,313 | 0.064 | 0.184 | |
| BoxPre+Backbone=TD32026.05 | 5,291 | 0.023 | 0.179 | |
| BoxPre+Backbone=SAC2026.05 | 5,204 | 0.034 | 0.159 | |
| Post(QP)Backbone=SAC2026.05 | 5,191 | 0.067 | 0.249 | |
| D-TanhBackbone=SAC2026.05 | 4,868 | 0.055 | 0.662 | |
| SRad-QPBackbone=SAC2026.05 | 4,558 | 0.11 | 0.053 | |
| Post(QP)Backbone=TD32026.05 | 4,420 | 0.026 | 0.465 | |
| SRad-QPBackbone=TD32026.05 | 3,810 | 0.087 | 0.015 | |
| SRad-StrictBackbone=SAC2026.05 | 2,742 | 0.493 | 0.024 | |
| SRad-StrictBackbone=TD32026.05 | 2,270 | 0.496 | 0.053 |