Reinforcement Learning on Acrobot v1
89.37Mean Returnπ-PRL
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| π-PRLAlgorithm=π-PRL, Policy Stage=final fine-tuned policy, Maximal Depth=62026.05 | 89.37 | — | — | — | |
| πdisc.-PRLAlgorithm=π-PRL, Policy Stage=discretized policy before fine-tuning, Maximal Depth=62026.05 | 86.63 | — | — | — | |
| πcont.-PRLAlgorithm=π-PRL, Policy Stage=relaxed policy before discretization, Maximal Depth=62026.05 | 80.31 | — | — | — | |
| DiPRLAlgorithm=DiPRL, Maximal Depth=62026.05 | 79.93 | — | — | — | |
| DTSemNetsAlgorithm=DTSemNets2026.05 | 78.98 | — | — | — | |
| VIPER (PPO)Algorithm=VIPER, Oracle Usage=PPO, Maximal Depth=62026.05 | 67.83 | — | — | — | |
| PPOAlgorithm=PPO, Policy Type=Neural2026.05 | 62.57 | — | — | — | |
| SAC-AdaGammaAdaptive-gamma=True2026.05 | -82.61 | — | — | — | |
| SACAdaptive-gamma=False2026.05 | -82.91 | — | — | — | |
| PPOAdaptive-gamma=False2026.05 | -95.34 | — | — | — | |
| ClassicalNumber of hidden neurons=322026.05 | -107.18 | — | — | 0.46 | |
| PPO-AdaGammaAdaptive-gamma=True2026.05 | -115.186 | — | — | — | |
| Hybrid_F2026.05 | -125.71 | — | — | 0.54 | |
| GB-DQNCondition=Multi-Regime Drift2025.12 | -140.16 | 88.52 | — | — | |
| CTMCinitialization=π2026.02 | -147.16 | 71.06 | — | — | |
| Hybrid_FT2026.05 | -148.58 | — | — | 0.64 | |
| Sliding-DQNCondition=Multi-Regime Drift2025.12 | -149.59 | 85.72 | — | — | |
| ClassicalNumber of hidden neurons=242026.05 | -150.1 | — | — | 0.64 | |
| Hybrid_T2026.05 | -154.09 | — | — | 0.66 | |
| DQNCondition=Multi-Regime Drift2025.12 | -154.82 | 85.56 | — | — | |
| Sample π2026.02 | -156.9 | 82.4 | — | — | |
| ClassicalNumber of hidden neurons=162026.05 | -162.14 | — | — | 0.69 | |
| CTMCinitialization=uniform2026.02 | -164.69 | 84.03 | — | — | |
| Ensemble-DQNCondition=Multi-Regime Drift2025.12 | -166.32 | 97.39 | — | — | |
| Argmax heuristic2026.02 | -172.6 | 106.6 | — | — | |
| ClassicalNumber of options=42026.05 | -196.63 | — | — | 0.84 | |
| ClassicalNumber of options=32026.05 | -218.71 | — | — | 0.94 | |
| Classical2026.05 | -233.44 | — | — | 1 | |
| Hybrid_FP2026.05 | -245.62 | — | — | 1.05 | |
| Reset-DQNCondition=Multi-Regime Drift2025.12 | -264.58 | 130.77 | — | — | |
| Hybrid_P2026.05 | -273.76 | — | — | 1.17 | |
| Hybrid_PNumber of options=42026.05 | -304.7 | — | — | 1.31 | |
| Hybrid_PNumber of options=32026.05 | -309.2 | — | — | 1.32 | |
| Random2026.02 | -498 | 19.9 | — | — | |
| Hybrid_O2026.05 | -498.16 | — | — | 2.13 | |
| Hybrid_FO2026.05 | -498.54 | — | — | 2.14 | |
| Hybrid_FOTP2026.05 | -498.94 | — | — | 2.14 | |
| Random2026.05 | -499.02 | — | — | 2.14 | |
| Sat-EnQReward Sparsity=Sparse Rewards2025.12 | -5,000 | — | 0 | — | |
| Bootstrapped DQNReward Sparsity=Sparse Rewards2025.12 | -7,518 | — | 85 | — | |
| Double DQNReward Sparsity=Sparse Rewards2025.12 | -7,715 | — | 90 | — | |
| DQNReward Sparsity=Sparse Rewards2025.12 | -8,013 | — | 95 | — |