Reinforcement Learning on Procgen Jumper 1.0 (train levels)
9.2Mean Train PerformancePB2-Mix
Evaluation Results
| Method | Links | |
|---|---|---|
| PB2-MixNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 9.2 | |
| PB2-RandNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 9 | |
| PB2-MultNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 8.9 | |
| PPONumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 8.3 | |
| PBTNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 8.3 | |
| UCB-DrACNumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 8.1 |