Reinforcement Learning on PortfolioOptEnv v0
10,550.9Average Episodic RewardPDA
Evaluation Results
| Method | Links | |
|---|---|---|
| PDAEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 10,550.9 | |
| TRPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 10,195.6 | |
| NPGEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 10,095.3 | |
| PPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 10,062.3 |