Continuous Control on MuJoCo Walker2d v2 (train)
5,278Mean ReturnPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPOEnvironment steps=10M, Number of runs=52022.04 | 5,278 | |
| MCPOEnvironment steps=10M, Number of runs=52022.04 | 5,120 | |
| Mean ψEnvironment steps=10M, Number of runs=5, N=402022.04 | 5,056 | |
| TRGPPOEnvironment steps=10M, Number of runs=52022.04 | 5,009 | |
| MDPOEnvironment steps=10M, Number of runs=52022.04 | 4,957 | |
| TRPOEnvironment steps=10M, Number of runs=52022.04 | 3,966 |