Reinforcement Learning on Pendulum (Average Episode Reward)
-145.49Avg Episode RewardTRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| TRPO2023.11 | -145.49 | |
| TD32025.02 | -147.1 | |
| SALSA-RLLatent dimension size (hd)=32025.02 | -149.2 | |
| SALSA-RLLatent dimension size (hd)=42025.02 | -149.8 | |
| SALSA-RLLatent dimension size (hd)=162025.02 | -149.9 | |
| ESPL2023.11 | -151.72 | |
| PPO2025.02 | -154.8 | |
| SAC2023.11 | -154.82 | |
| TD32023.11 | -155.06 | |
| DSP2023.11 | -155.4 | |
| DDPG2023.11 | -155.6 | |
| SALSA-RLLatent dimension size (hd)=62025.02 | -155.8 | |
| SALSA-RLLatent dimension size (hd)=82025.02 | -157.1 | |
| A2C2023.11 | -157.59 | |
| SAC2025.02 | -159.3 | |
| PPO2023.11 | -160.14 | |
| DSP2025.02 | -160.5 | |
| A2C2025.02 | -162.2 | |
| DDPG2025.02 | -169 | |
| AC-CGbatch size=1000, seeds=52026.01 | -190 | |
| ACKTR2023.11 | -201.57 | |
| AC-KFACbatch size=1000, seeds=52026.01 | -1,161 | |
| Regression2023.11 | -1,206.9 | |
| AC-SGDbatch size=1000, seeds=52026.01 | -2,116 | |
| SMACbatch size=1000, seeds=52026.01 | -2,226 | |
| AC-Adambatch size=1000, seeds=52026.01 | -5,731 |