Reinforcement Learning on NewsvendorEnv 1M v0
-150,000Average Episodic RewardPDA
Evaluation Results
| Method | Links | |
|---|---|---|
| PDAEnvironment steps=1M, Number of seeds=10, Tests per epoch=5002026.03 | -150,000 | |
| PPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=5002026.03 | -190,000 | |
| NPGEnvironment steps=1M, Number of seeds=10, Tests per epoch=5002026.03 | -27,000,000 | |
| TRPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=5002026.03 | -34,000,000 |