Continuous Control on MuJoCo Hopper v2 (train)
3,713Mean ReturnTRGPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| TRGPPOEnvironment steps=10M, Number of runs=52022.04 | 3,713 | |
| MCPOEnvironment steps=10M, Number of runs=52022.04 | 3,620 | |
| Mean ψEnvironment steps=10M, Number of runs=5, N=402022.04 | 3,430 | |
| TRPOEnvironment steps=10M, Number of runs=52022.04 | 3,159 | |
| MDPOEnvironment steps=10M, Number of runs=52022.04 | 3,153 | |
| PPOEnvironment steps=10M, Number of runs=52022.04 | 2,968 |