Reinforcement Learning on Hopper v5 (with Safety Metrics)
1,005ReturnCPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CPO2026.02 | 1,005 | 0.976 | |
| A2C-GP-Shield2026.02 | 1,000 | 1 | |
| MPS2026.02 | 1,000 | 1 | |
| DMPS2026.02 | 1,000 | 1 | |
| PPO-Lag2026.02 | 624 | 0 |
| Method | Links | ||
|---|---|---|---|
| CPO2026.02 | 1,005 | 0.976 | |
| A2C-GP-Shield2026.02 | 1,000 | 1 | |
| MPS2026.02 | 1,000 | 1 | |
| DMPS2026.02 | 1,000 | 1 | |
| PPO-Lag2026.02 | 624 | 0 |