Reinforcement Learning on MountainCarContinuous v0 (Average Agent Reward)
98.75Average Agent RewardR2PO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| R2POEpisodes per run=4,000, Language Model backbone=gpt-oss:20b, Independent runs=102026.05 | 98.75 | — | |
| R2PONumber of independent runs=102026.05 | 98.75 | — | |
| ProPS+Number of independent runs=102026.05 | 98.7 | — | |
| SA-DTDepth (d)=5, Number of random trials=252026.03 | 97 | — | |
| SA-DTDepth (d)=8, Number of random trials=252026.03 | 96 | — | |
| MLPNumber of random trials=252026.03 | 95 | — | |
| SACSource=Best SB3, Number of independent runs=102026.05 | 94.81 | — | |
| SAC-AdaGammaAdaptive-gamma=True2026.05 | 94.6 | — | |
| SACAdaptive-gamma=False2026.05 | 94.47 | — | |
| SYMPOLNumber of random trials=252026.03 | 94 | — | |
| CBRLEpisode Number=1502024.06 | 93.63 | 0.21 | |
| CBRLEpisode Number=2002024.06 | 93.63 | 0.21 | |
| CBRLEpisode Number=2502024.06 | 93.63 | 0.21 | |
| CBRLEpisode Number=3002024.06 | 93.63 | 0.21 | |
| CBRLEpisode Number=3502024.06 | 93.63 | 0.21 | |
| CBRLEpisode Number=4002024.06 | 93.63 | 0.21 | |
| CBRLEpisode Number=4502024.06 | 93.63 | 0.21 | |
| CBRLEpisode Number=5002024.06 | 93.63 | 0.21 | |
| DDPGEpisode Number=3002024.06 | 93.62 | 0.35 | |
| POEMEvaluation Episodes=152026.01 | 93.52 | — | |
| DDPGEpisode Number=3502024.06 | 93.39 | 0.51 | |
| DDPGEpisode Number=2502024.06 | 93.18 | 0.41 | |
| DDPGEpisode Number=4002024.06 | 93.15 | 0.81 | |
| CBRLEpisode Number=1002024.06 | 93.03 | 0.37 | |
| DDPGEpisode Number=2002024.06 | 92.82 | 0.89 | |
| DDPGEpisode Number=5002024.06 | 92.72 | 0.75 | |
| DDPGEpisode Number=4502024.06 | 92.67 | 0.85 | |
| DDPGEpisode Number=1502024.06 | 91.98 | 1.47 | |
| ProPS+Episodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 89.16 | — | |
| DDPGEpisode Number=1002024.06 | 89.1 | 4.78 | |
| ProPSEpisodes per run=8,000, Language Model backbone=GPT-4o, Independent runs=102026.05 | 87.21 | — | |
| PPO-AdaGammaAdaptive-gamma=True2026.05 | 86.84 | — | |
| SACEpisodes per run=8,000, Independent runs=102026.05 | 86.65 | — | |
| PPOAdaptive-gamma=False2026.05 | 84.72 | — | |
| SACNumber of runs=10, Aggregation protocol=averaged across all training iterations, Source=Best SB32026.05 | 82.33 | — | |
| R2PONumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 81.61 | — | |
| PPOEpisode Number=4002024.06 | 81.32 | 1.63 | |
| PPOEpisode Number=4502024.06 | 81.1 | 2.02 | |
| CBRLEpisode Number=502024.06 | 79.34 | 1.02 | |
| PPOEpisodes per run=8,000, Independent runs=102026.05 | 78.16 | — | |
| PPOEpisode Number=5002024.06 | 76.31 | 1.74 | |
| PPOEpisode Number=3502024.06 | 76.23 | 3.03 | |
| ProPSNumber of independent runs=102026.05 | 75.37 | — | |
| DDPGEpisode Number=502024.06 | 74.2 | 7.2 | |
| PPOEpisode Number=2502024.06 | 71.35 | 13.15 | |
| PPOEpisode Number=3002024.06 | 71.25 | 12.27 | |
| PPOEpisode Number=1502024.06 | 69.58 | 10.57 | |
| PPOEpisode Number=2002024.06 | 66.36 | 12.27 | |
| LinearEpisode Number=4502024.06 | 66.19 | 20.54 | |
| PPOEpisode Number=1002024.06 | 65.01 | 9.69 | |
| LinearEpisode Number=1502024.06 | 63.12 | 19.53 | |
| LinearEpisode Number=4002024.06 | 62.42 | 25.91 | |
| LinearEpisode Number=2502024.06 | 62.3 | 25.59 | |
| LinearEpisode Number=3002024.06 | 62 | 25.12 | |
| LinearEpisode Number=2002024.06 | 61.94 | 21.83 | |
| LinearEpisode Number=1002024.06 | 61.64 | 17.19 | |
| LinearEpisode Number=5002024.06 | 61.52 | 28.84 | |
| LinearEpisode Number=502024.06 | 61.09 | 16.84 | |
| PPOEpisode Number=502024.06 | 59.62 | 7.32 | |
| LinearEpisode Number=3502024.06 | 57.13 | 34.55 | |
| ProPSNumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 23.45 | — | |
| ProPS+Number of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 17.9 | — | |
| SDTNumber of random trials=252026.03 | 4 | — | |
| D-SDTNumber of random trials=252026.03 | -10 | — | |
| PPOEvaluation Episodes=152026.01 | -311.75 | — |