Safe Reinforcement Learning on AntButton (test)
0Violation RateTD3ADRC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TD3ADRCBase Algorithm=TD3, Lagrangian Method Type=ADRC2026.01 | 0 | 0 | 0.86 | |
| TRPOADRCBase Algorithm=TRPO, Lagrangian Method Type=ADRC2026.01 | 0 | 0 | 4.15 | |
| CPPOADRCBase Algorithm=CPPO, Lagrangian Method Type=ADRC2026.01 | 1 | 0 | 2.69 | |
| TRPOLagBase Algorithm=TRPO, Lagrangian Method Type=Lag2026.01 | 1 | 0 | 4.4 | |
| TRPOPIDBase Algorithm=TRPO, Lagrangian Method Type=PID2026.01 | 1 | 0 | 4.29 | |
| CPPOLagBase Algorithm=CPPO, Lagrangian Method Type=Lag2026.01 | 22 | 0.83 | 6.09 | |
| CPPOPIDBase Algorithm=CPPO, Lagrangian Method Type=PID2026.01 | 30 | 0.01 | 6.95 | |
| DDPGADRCBase Algorithm=DDPG, Lagrangian Method Type=ADRC2026.01 | 193 | 0.12 | 4.87 | |
| TD3PIDBase Algorithm=TD3, Lagrangian Method Type=PID2026.01 | 224 | 0.11 | 3.14 | |
| TD3LagBase Algorithm=TD3, Lagrangian Method Type=Lag2026.01 | 331 | 0.32 | 6.22 | |
| DDPGLagBase Algorithm=DDPG, Lagrangian Method Type=Lag2026.01 | 572 | 0.3 | 7.35 | |
| DDPGPIDBase Algorithm=DDPG, Lagrangian Method Type=PID2026.01 | 622 | 0.47 | 7.92 |