Reinforcement Learning on Walker2d discrete-regime exponential dwell
374Mean ReturnESCP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ESCPNumber of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations2026.05 | 374 | 75 | — | |
| BAPR (no per-trans)Number of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations, per-transition belief storage=Disabled2026.05 | 353 | 26 | 14 | |
| BAPR (full)Number of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations, per-transition belief storage=Enabled2026.05 | 323 | — | — | |
| SACNumber of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations2026.05 | 310 | 6 | — |