Safe Reinforcement Learning on CarPush
34.75Violation RateTRPOADRC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TRPOADRCBackbone=TRPO, Controller=ADRC2026.01 | 34.75 | 6.32 | 22.4 | |
| TD3ADRCBackbone=TD3, Controller=ADRC2026.01 | 39.92 | 5.15 | 23.64 | |
| TRPOPIDBackbone=TRPO, Controller=PID2026.01 | 40.05 | 6.66 | 23.92 | |
| CPPOADRCBackbone=PPO, Controller=ADRC2026.01 | 42.23 | 11.68 | 29.16 | |
| DDPGADRCBackbone=DDPG, Controller=ADRC2026.01 | 42.43 | 7.07 | 25.7 | |
| TD3LagBackbone=TD3, Controller=Lagrangian2026.01 | 46.97 | 6.27 | 25.51 | |
| TRPOLagBackbone=TRPO, Controller=Lagrangian2026.01 | 48.24 | 8.51 | 27.58 | |
| DDPGLagBackbone=DDPG, Controller=Lagrangian2026.01 | 48.81 | 8.2 | 27.37 | |
| DDPGPIDBackbone=DDPG, Controller=PID2026.01 | 48.81 | 8.2 | 27.37 | |
| TD3PIDBackbone=TD3, Controller=PID2026.01 | 49.83 | 7.65 | 26.66 | |
| CPPOPIDBackbone=PPO, Controller=PID2026.01 | 62.36 | 12.4 | 33.74 | |
| CPPOLagBackbone=PPO, Controller=Lagrangian2026.01 | 68.45 | 21.48 | 43.38 |