Reinforcement Learning on MuJoCo humanoid variants v4
1,365.6Runtime (s)TRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| TRPOHardware=Intel i7-14700K, Environment steps=1M, Number of parallel runs=52026.03 | 1,365.6 | |
| PDAHardware=Intel i7-14700K, Environment steps=1M, Number of parallel runs=52026.03 | 1,480.7 | |
| NPGHardware=Intel i7-14700K, Environment steps=1M, Number of parallel runs=52026.03 | 1,484.3 | |
| PPOHardware=Intel i7-14700K, Environment steps=1M, Number of parallel runs=52026.03 | 1,720.8 |