Reinforcement Learning on Hopper discrete-regime, exponential dwell
565Mean Evaluation ReturnESCP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ESCPNumber of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations2026.05 | 565 | 110 | — | |
| SACNumber of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations2026.05 | 445 | 61 | — | |
| BAPR (no per-trans)Number of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations, per-transition belief storage=Disabled2026.05 | 420 | 23 | -6 |