Reinforcement Learning on Hopper (Reward, Cost, Violation Rate)
1,520.18Avg RewardADRC Lagrangian
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ADRC LagrangianFramework=CPPO2026.01 | 1,520.18 | 8.2 | 24.63 | |
| PID LagrangianFramework=CPPO2026.01 | 1,466.47 | 48.2 | 30 | |
| ADRC LagrangianFramework=TRPO2026.01 | 1,384.11 | 12.9 | 10.98 | |
| PID LagrangianFramework=TRPO2026.01 | 1,038.47 | 18.7 | 29.76 |