Reinforcement Learning on Pendulum (train)
0.834Normalized ScorePPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPOPolicy Type=Deep Reinforcement Learning2026.06 | 0.834 | |
| REFLEXPolicy Type=Programmatic & Evolutionary Policies2026.06 | 0.694 | |
| MLESPolicy Type=Programmatic & Evolutionary Policies2026.06 | 0.602 | |
| Initial policyPolicy Type=Programmatic & Evolutionary Policies2026.06 | 0.301 |