Reinforcement Learning on Pusher
142Average ReturnsMulti-task
Evaluation Results
| Method | Links | |
|---|---|---|
| Multi-taskTarget Network=MLP (2x200), Hypernetwork=MLP (2x50)2020.09 | 142 | |
| HyperCRLTarget Network=MLP (2x200), Hypernetwork=MLP (2x50)2020.09 | 99 | |
| CoresetTarget Network=MLP (2x200), Hypernetwork=MLP (2x50)2020.09 | 87 | |
| SITarget Network=MLP (2x200), Hypernetwork=MLP (2x50)2020.09 | 40 | |
| DF-CWP-CPNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 39.88 | |
| A2CNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 32.41 | |
| CG-FPDNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 27.23 | |
| PPONumber of training seeds=5, Number of evaluation episodes=1002026.03 | 25.5 | |
| SACNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 25.5 | |
| EWCTarget Network=MLP (2x200), Hypernetwork=MLP (2x50)2020.09 | 7 | |
| FinetuningTarget Network=MLP (2x200), Hypernetwork=MLP (2x50)2020.09 | 0 | |
| SMACbatch size=1000, seeds=52026.01 | -408.2 | |
| AC-SGDbatch size=1000, seeds=52026.01 | -433.6 | |
| AC-CGbatch size=1000, seeds=52026.01 | -441 | |
| AC-Adambatch size=1000, seeds=52026.01 | -568.3 | |
| AC-KFACbatch size=1000, seeds=52026.01 | -1,086.3 |