Reinforcement Learning on CartPole (Max Return)
500Max ReturnPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPONumber of training seeds=5, Number of evaluation episodes=1002026.03 | 500 | |
| A2CNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 500 | |
| DQNNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 500 | |
| CG-FPDNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 500 | |
| DF-CWP-CPNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 500 | |
| R2PONumber of independent runs=102026.05 | 500 | |
| Adaptive βNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 492 | |
| TRPOSource=Best SB3, Number of independent runs=102026.05 | 490.76 | |
| Fixed βNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 484 | |
| PPO-ClipNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 478 | |
| per-sample PPO-KLNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 478 | |
| ProPSNumber of independent runs=102026.05 | 427.74 | |
| ProPS+Number of independent runs=102026.05 | 396.21 |