Reinforcement Learning on Procgen CaveFlyer 1.0 (train)
7.5Mean Performance (Train)PB2-Mix
Evaluation Results
| Method | Links | |
|---|---|---|
| PB2-MixNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 7.5 | |
| PB2-RandNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 7.3 | |
| PBTNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 7.2 | |
| PB2-MultNumber of Agents=4, Timesteps=25M, Hyperparameter Initialization=Random, Evaluation Trials=1002021.06 | 7 | |
| PPONumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 6.8 | |
| UCB-DrACNumber of Agents=1, Timesteps=25M, Hyperparameter Initialization=Optimized, Evaluation Trials=1002021.06 | 5.7 |