Reinforcement Learning on Gymnasium Pendulum
-145.6Cumulative ReturnSAC Base
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SAC BaseRL Algorithm=SAC2026.01 | -145.6 | 0.421 | |
| GRADRL Algorithm=SAC2026.01 | -145.6 | 0.345 | |
| ASAPRL Algorithm=SAC2026.01 | -145.7 | 0.338 | |
| L2C2RL Algorithm=SAC2026.01 | -146.2 | 0.383 | |
| CAPSRL Algorithm=SAC2026.01 | -149.4 | 0.304 | |
| PPO BaseBase RL Algorithm=PPO2026.01 | -169.4 | 0.383 | |
| ASAPBase RL Algorithm=PPO2026.01 | -178.6 | 0.318 | |
| GRADBase RL Algorithm=PPO2026.01 | -199.1 | 0.336 | |
| L2C2Base RL Algorithm=PPO2026.01 | -203 | 0.387 | |
| CAPSBase RL Algorithm=PPO2026.01 | -238.2 | 0.323 |