Reinforcement Learning on Swimmer (Gymnasium)
294.57Mean Best RewardR2PO
Evaluation Results
| Method | Links | |
|---|---|---|
| R2POEpisodes per run=4,000, Language Model backbone=gpt-oss:20b, Independent runs=102026.05 | 294.57 | |
| ProPS+Episodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 227.3 | |
| ProPSEpisodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 218.83 | |
| TRPOEpisodes per run=8,000, Independent runs=102026.05 | 52.96 | |
| A2CEpisodes per run=8,000, Independent runs=102026.05 | 39.4 |