Continuous Control on Walker2d (Parameter Perturbation Analysis)
1,084.8Return (p_act=0.1)Self-Paced
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Self-PacedTraining steps=1 million, Evaluation episodes=1002025.11 | 1,084.8 | 696.5 | 478.9 | 378 | 282.4 | 1,070.5 | 581.3 | 441.1 | 371.2 | 290.9 | 2,014.5 | 1,439.5 | 1,077.9 | 870.3 | 635.9 | |
| PPOTraining steps=1 million, Evaluation episodes=1002025.11 | 1,048.3 | 651.4 | 453.2 | 349.7 | 257.7 | 732.4 | 392 | 333.6 | 260.3 | 208.7 | 1,624.5 | 1,199.6 | 914.8 | 714.9 | 610.7 | |
| SPACETraining steps=1 million, Evaluation episodes=1002025.11 | 1,020.1 | 708.9 | 494.6 | 370.6 | 264.1 | 823.3 | 425 | 308.4 | 241.8 | 195.5 | 1,352 | 1,068 | 908.4 | 714 | 580.5 | |
| LinearTraining steps=1 million, Evaluation episodes=1002025.11 | 667.4 | 515.8 | 427.6 | 353.2 | 293 | 544.6 | 347.3 | 255.5 | 193.4 | 146.1 | 895.8 | 734 | 637.3 | 536.4 | 512.3 | |
| ACCELTraining steps=1 million, Evaluation episodes=1002025.11 | 616.6 | 441.7 | 361.2 | 313 | 232.9 | 501 | 382.1 | 307.9 | 272.4 | 235.5 | 1,021.3 | 812.4 | 652.9 | 534.7 | 461 | |
| Dom. Rand.Training steps=1 million, Evaluation episodes=1002025.11 | 473.8 | 366.4 | 288.4 | 224.2 | 156.4 | 339.8 | 249.4 | 211.1 | 174.1 | 129.3 | 642 | 561.3 | 502.8 | 408.8 | 367.7 | |
| FixedTraining steps=1 million, Evaluation episodes=1002025.11 | 425.8 | 340.9 | 263.6 | 166.8 | 100.6 | 365.2 | 176.2 | 95.6 | 62.3 | 44 | 477.1 | 443.9 | 393.4 | 338.5 | 293.1 |