Linear off-policy prediction on Baird environment
2.21Max RMSETD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TDalpha=0.01, total runs=102026.05 | 2.21 | 10 | |
| ETDalpha=0.01, total runs=502026.05 | 2.41 | 50 | |
| GTD2alpha=0.01, total runs=102026.05 | 5.318 | 0 | |
| TETDalpha=0.01, total runs=502026.05 | 5.44 | 50 | |
| TDRCalpha=0.01, total runs=102026.05 | 11.35 | 0 | |
| TDCalpha=0.01, total runs=102026.05 | 11.5 | 0 | |
| CETDalpha=0.01, total runs=102026.05 | 17.54 | 0 | |
| RETDalpha=0.01, total runs=102026.05 | 21.16 | 0 |