Reinforcement Learning on Ant tight heterogeneous constraints v5 (test)
4,260ReturnDD-SRad
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DD-SRadBackbone=TD3, Seeds=52026.05 | 4,260 | 4.1 | 54.8 | |
| D-TanhBackbone=TD3, Seeds=52026.05 | 3,484 | 22.4 | 56.5 | |
| BoxPre+Backbone=TD3, Seeds=52026.05 | 2,917 | 9.9 | 51.8 | |
| SRad-QPBackbone=TD3, Seeds=52026.05 | 2,147 | 9.1 | 55.4 | |
| Post(QP)Backbone=TD3, Seeds=52026.05 | 1,998 | 14.1 | 68.9 | |
| SRad-StrictBackbone=TD3, Seeds=52026.05 | 1,246 | 30.2 | 17.6 |