Reinforcement Learning on MountainCar (Average Episode Reward)
199.99Avg Episode RewardDQN
Evaluation Results
| Method | Links | |
|---|---|---|
| DQNNumber of runs=10, Aggregation protocol=averaged across all training iterations, Source=Best SB32026.05 | 199.99 | |
| ProPSNumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 199.31 | |
| ProPS+Number of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 195.81 | |
| R2PONumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 147.84 | |
| DSP2023.11 | 0.9911 | |
| Human BestMethod Type=Human Baseline2026.06 | 0.99 | |
| ARTSBase Model=o32026.06 | 0.9573 | |
| DDPG2023.11 | 0.9536 | |
| Regression2023.11 | 0.9516 | |
| SAC2023.11 | 0.9468 | |
| ESPL2023.11 | 0.9402 | |
| A2C2023.11 | 0.9397 | |
| TD32023.11 | 0.9387 | |
| ACKTR2023.11 | 0.9379 | |
| PPO2023.11 | 0.9376 | |
| TRPO2023.11 | 0.936 | |
| ARTS*Base Model=Qwen 4B, Test-time trained=true2026.06 | 0.9194 | |
| MLEvolveMethod Type=Prior Works2026.06 | 0.8484 | |
| AIRAMethod Type=Prior Works2026.06 | 0.8082 | |
| ARTSBase Model=Qwen 4B2026.06 | 0.5665 | |
| LinearMethod Type=Prior Works2026.06 | 0.4544 | |
| Average Human2024.05 | -70 | |
| DDQN2024.05 | -100 | |
| FDQN2024.05 | -107 | |
| DQN2024.05 | -110 |