Reinforcement Learning on Procgen CoinRun 1.0 (train)
10Mean Train PerformancePB2-Rand
Evaluation Results
| Method | Links | |
|---|---|---|
| PB2-RandNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 10 | |
| PB2-MultNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 9.9 | |
| PB2-MixNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 9.6 | |
| UCB-DrACNumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 9.5 | |
| PPONumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 9.3 | |
| PBTNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 8.2 |