Reinforcement Learning on NewsvendorEnv 3M v0
21,857.9Average Episodic RewardPDA
Evaluation Results
| Method | Links | |
|---|---|---|
| PDAEnvironment steps=3M, Number of seeds=10, Tests per epoch=5002026.03 | 21,857.9 | |
| PPOEnvironment steps=3M, Number of seeds=10, Tests per epoch=5002026.03 | -37,225.9 | |
| NPGEnvironment steps=3M, Number of seeds=10, Tests per epoch=5002026.03 | -10,000,000 | |
| TRPOEnvironment steps=3M, Number of seeds=10, Tests per epoch=5002026.03 | -53,000,000 |