Safe Reinforcement Learning on CarButton (test)
50.16Violation RateCPPOADRC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CPPOADRCBase Algorithm=PPO, Controller=ADRC2026.01 | 50.16 | 14.8 | 34.2 | |
| TRPOADRCBase Algorithm=TRPO, Controller=ADRC2026.01 | 53.28 | 8.53 | 29.57 | |
| TRPOPIDBase Algorithm=TRPO, Controller=PID2026.01 | 69.04 | 14.6 | 37.11 | |
| TRPOLagBase Algorithm=TRPO, Controller=Lagrangian2026.01 | 74.24 | 21.9 | 44.84 | |
| CPPOPIDBase Algorithm=PPO, Controller=PID2026.01 | 85.09 | 45.27 | 68.95 | |
| CPPOLagBase Algorithm=PPO, Controller=Lagrangian2026.01 | 89.77 | 59.77 | 84.05 | |
| DDPGPIDBase Algorithm=DDPG, Controller=PID2026.01 | 98.87 | 64.1 | 89.05 | |
| TD3PIDBase Algorithm=TD3, Controller=PID2026.01 | 99.03 | 59.44 | 84.4 | |
| TD3ADRCBase Algorithm=TD3, Controller=ADRC2026.01 | 99.04 | 50.84 | 75.8 | |
| DDPGADRCBase Algorithm=DDPG, Controller=ADRC2026.01 | 99.49 | 58.62 | 83.6 | |
| DDPGLagBase Algorithm=DDPG, Controller=Lagrangian2026.01 | 99.93 | 58.18 | 83.17 | |
| TD3LagBase Algorithm=TD3, Controller=Lagrangian2026.01 | 99.97 | 62.2 | 87.2 |