Continuous Control on MuJoCo Ant v2 (train)
4,796Mean ReturnTRGPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| TRGPPOEnvironment steps=10M, Number of runs=52022.04 | 4,796 | |
| MCPOEnvironment steps=10M, Number of runs=52022.04 | 4,673 | |
| Mean ψEnvironment steps=10M, Number of runs=5, N=402022.04 | 4,570 | |
| MDPOEnvironment steps=10M, Number of runs=52022.04 | 3,553 | |
| PPOEnvironment steps=10M, Number of runs=52022.04 | 3,421 | |
| TRPOEnvironment steps=10M, Number of runs=52022.04 | 2,438 |