Continuous Control on Humanoid
680.1Humanoid Return (p_act=0.1)Self-Paced
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Self-PacedTraining steps=1 million, Evaluation episodes=1002025.11 | 680.1 | 633.6 | 571 | 469.4 | 399.5 | 332.6 | 331.6 | 325.6 | 307 | 317.5 | 215.8 | 206.9 | 218.8 | 213.1 | 215.1 | |
| ACCELTraining steps=1 million, Evaluation episodes=1002025.11 | 622.9 | 577.3 | 529 | 451.9 | 359.4 | 235.6 | 228.8 | 233.1 | 233.5 | 235.4 | 158.4 | 137.7 | 150.3 | 143.6 | 137.7 | |
| LinearTraining steps=1 million, Evaluation episodes=1002025.11 | 599 | 574 | 508.2 | 456.2 | 372 | 228.7 | 227.4 | 229.3 | 236.1 | 234 | 146.5 | 143.1 | 146.2 | 139.4 | 136.9 | |
| SPACETraining steps=1 million, Evaluation episodes=1002025.11 | 598.5 | 566.7 | 516.5 | 452 | 386 | 214.3 | 216.4 | 207.2 | 214.4 | 210.4 | 137.5 | 131.4 | 134.7 | 138.3 | 130.6 | |
| PPOTraining steps=1 million, Evaluation episodes=1002025.11 | 588 | 554.2 | 516.4 | 455.4 | 384.4 | 208.3 | 207.3 | 200.8 | 203.9 | 203.3 | 133.2 | 134.9 | 131.7 | 128.2 | 126.5 | |
| Dom. Rand.Training steps=1 million, Evaluation episodes=1002025.11 | 542.1 | 508 | 411.4 | 325 | 237.6 | 151.4 | 159.4 | 163.7 | 153.3 | 153.4 | 143.7 | 138 | 129.8 | 133 | 131.9 | |
| FixedTraining steps=1 million, Evaluation episodes=1002025.11 | 499.8 | 439.4 | 336.7 | 242.8 | 176.7 | 133.5 | 134.4 | 140.6 | 130.6 | 136.6 | 132.1 | 131.2 | 136.8 | 135.2 | 127.6 |