Reinforcement Learning on Ant discrete-regime, exponential dwell
20,679Mean Evaluation ReturnBAPR (no per-trans)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BAPR (no per-trans)Number of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations, per-transition belief storage=Disabled2026.05 | 20,679 | 3,402 | 20 | |
| BAPR (full)Number of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations, per-transition belief storage=Enabled2026.05 | 20,284 | 3,564 | — | |
| SACNumber of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations2026.05 | 17,171 | 194 | — | |
| ESCPNumber of seeds (N)=3, training iterations=1 500, c_penalty=0.5, K (test modes)=4, evaluation window=last 200 iterations2026.05 | 4,600 | 4,406 | — |