Safety Reinforcement Learning on SafetyPointGoal1 v0
27.45RewardDDPG-AdaGamma
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DDPG-AdaGammaBase Algorithm=DDPG, Discounting Strategy=AdaGamma2026.05 | 27.45 | 46.15 | |
| DDPG-Fixed-γBase Algorithm=DDPG, Discounting Strategy=Fixed-γ2026.05 | 27.34 | 51.45 | |
| DDPG-CrossValidateBase Algorithm=DDPG, Discounting Strategy=CrossValidate2026.05 | 27.26 | 53.85 | |
| DDPG-UncertaintyBase Algorithm=DDPG, Discounting Strategy=Uncertainty2026.05 | 27.1 | 52.7 | |
| TRPO-AdaGammaBase Algorithm=TRPO, Discounting Strategy=AdaGamma2026.05 | 25.93 | 49.4 | |
| TRPO-Fixed-γBase Algorithm=TRPO, Discounting Strategy=Fixed-γ2026.05 | 24.48 | 45.9 | |
| TRPO-CrossValidateBase Algorithm=TRPO, Discounting Strategy=CrossValidate2026.05 | 24.38 | 46.35 | |
| TRPO-UncertaintyBase Algorithm=TRPO, Discounting Strategy=Uncertainty2026.05 | 23.5 | 64.55 |