Reinforcement Learning on Procgen StarPilot 1.0 (train)
44.1Mean Train PerformancePB2-Rand
Evaluation Results
| Method | Links | |
|---|---|---|
| PB2-RandNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 44.1 | |
| PB2-MixNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 41.8 | |
| PB2-MultNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 40.3 | |
| UCB-DrACNumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 35.3 | |
| PBTNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 33.6 | |
| PPONumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 29.8 |