Reinforcement Learning on MountainCar (Maximum Evaluation Return)
200Maximum ReturnA2C
Evaluation Results
| Method | Links | |
|---|---|---|
| A2CEpisodes per run=8,000, Independent runs=102026.05 | 200 | |
| DQNEpisodes per run=8,000, Independent runs=102026.05 | 194.36 | |
| DQNNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 147.8 | |
| A2CNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 134.2 | |
| PPONumber of training seeds=5, Number of evaluation episodes=1002026.03 | 128.12 | |
| ProPSEpisodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 126.11 | |
| ProPS+Episodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 116.71 | |
| R2POEpisodes per run=4,000, Language Model backbone=gpt-oss:20b, Independent runs=102026.05 | 111.04 | |
| DF-CWP-CPNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 108.67 | |
| CG-FPDNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 105.8 | |
| R2PONumber of independent runs=102026.05 | -111.04 | |
| ProPS+Number of independent runs=102026.05 | -150.21 | |
| ProPSNumber of independent runs=102026.05 | -191.84 | |
| DQNSource=Best SB3, Number of independent runs=102026.05 | -197.47 |