Reinforcement Learning on Humanoid v3
11,888Avg Final ReturnDACER
Evaluation Results
| Method | Links | |
|---|---|---|
| DACER2024.05 | 11,888 | |
| DSAC2024.05 | 10,829 | |
| SAC2024.05 | 9,335 | |
| PPO2024.05 | 6,869 | |
| TD32024.05 | 5,631 | |
| DDPG2024.05 | 5,291 | |
| D2HPGDelta=52026.04 | 3,320.6 | |
| Delay-free SACDelta=02026.04 | 3,228.1 | |
| BPQLDelta=52026.04 | 3,162.9 | |
| D2HPGDelta=102026.04 | 2,996.4 | |
| BPQLDelta=102026.04 | 2,889.5 | |
| VDPODelta=52026.04 | 2,843.2 | |
| VDPODelta=102026.04 | 2,189.4 | |
| D2HPGDelta=202026.04 | 1,829.5 | |
| BPQLDelta=202026.04 | 1,197.7 | |
| TRPO2024.05 | 965 | |
| VDPODelta=202026.04 | 791.3 | |
| Augmented SACDelta=52026.04 | 629.2 | |
| Augmented SACDelta=102026.04 | 520.5 | |
| Delayed SACDelta=52026.04 | 505.9 | |
| Delayed SACDelta=202026.04 | 407.2 | |
| Naive SACDelta=52026.04 | 398.3 | |
| Naive SACDelta=102026.04 | 394.1 | |
| Naive SACDelta=202026.04 | 362.9 | |
| Delayed SACDelta=102026.04 | 341.6 | |
| Augmented SACDelta=202026.04 | 340.6 |