Reinforcement Learning on InvertedDoublePendulum Gymnasium
3,609.37Mean Best RewardTRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| TRPOEpisodes per run=8,000, Independent runs=102026.05 | 3,609.37 | |
| R2POEpisodes per run=4,000, Language Model backbone=gpt-oss:20b, Independent runs=102026.05 | 254.04 | |
| ProPS+Episodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 148.39 | |
| ProPSEpisodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 128.17 | |
| PPOEpisodes per run=8,000, Independent runs=102026.05 | 108.6 |