Reinforcement Learning on Procgen FruitBot 1.0 (train)
32.2Mean Train PerformancePB2-Rand
Evaluation Results
| Method | Links | |
|---|---|---|
| PB2-RandNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 32.2 | |
| PB2-MixNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 30.9 | |
| PB2-MultNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 30.5 | |
| UCB-DrACNumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 29.5 | |
| PPONumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 29.1 | |
| PBTNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 27.4 |