Reinforcement Learning on Ant delta=[0.2^4, 0.5^4], kappa=2.5 v5 (test)
4,260ReturnDD-SRad
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DD-SRadBackbone=TD32026.05 | 4,260 | 4.1 | 54.8 | |
| D-TanhBackbone=TD32026.05 | 3,484 | 22.4 | 56.5 | |
| DD-SRadBackbone=SAC2026.05 | 3,112 | 25.3 | 49.2 | |
| BoxPre+Backbone=TD32026.05 | 2,917 | 9.9 | 51.8 | |
| D-TanhBackbone=SAC2026.05 | 2,719 | 6.4 | 57 | |
| SRad-QPBackbone=TD32026.05 | 2,147 | 9.1 | 55.4 | |
| BoxPre+Backbone=SAC2026.05 | 1,998 | 6.3 | 45.3 | |
| Post(QP)Backbone=TD32026.05 | 1,998 | 14.1 | 68.9 | |
| SRad-QPBackbone=SAC2026.05 | 1,703 | 13.6 | 58.3 | |
| Post(QP)Backbone=SAC2026.05 | 1,517 | 9 | 65.1 | |
| SRad-StrictBackbone=SAC2026.05 | 1,448 | 68.8 | 14.1 | |
| SRad-StrictBackbone=TD32026.05 | 1,246 | 30.2 | 17.6 |