Reinforcement Learning on Loop environment 2 Loops
395Average ReturnEUBRL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EUBRLsteps=1000, random seeds=500, number of loops=22025.12 | 395 | 0.04 | |
| RMAXsteps=1000, random seeds=500, number of loops=22025.12 | 394 | 0 | |
| BEBsteps=1000, random seeds=500, number of loops=22025.12 | 386 | 0 | |
| PSRLsteps=1000, random seeds=500, number of loops=22025.12 | 377 | 1 | |
| Mean-MDPsteps=1000, random seeds=500, number of loops=22025.12 | 233 | 3.4 |