Reinforcement Learning on LunarLander (Maximum evaluation return)
260.6Maximum ReturnDF-CWP-CP
Evaluation Results
| Method | Links | |
|---|---|---|
| DF-CWP-CPNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 260.6 | |
| DQNNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 250.1 | |
| PPONumber of training seeds=5, Number of evaluation episodes=1002026.03 | 246.6 | |
| A2CNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 246.6 | |
| CG-FPDNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 241.2 | |
| Adaptive βNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 125 | |
| Fixed βNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 121 | |
| PPO-ClipNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 107 | |
| per-sample PPO-KLNumber of seeds=5, Evaluation window=last 10% of training2026.06 | 107 |