Offline Reinforcement Learning on TutorBot POMDP n=200
1.43Avg True ReturnOptimal Policy
Evaluation Results
| Method | Links | |
|---|---|---|
| Optimal Policy2022.10 | 1.43 | |
| SSR-RRSrepeats=5, re-trained_on_full_dataset=true2022.10 | 1.38 | |
| CVfolds=2, re-trained_on_full_dataset=true2022.10 | 1.34 | |
| SSR-RRSrepeats=2, re-trained_on_full_dataset=true2022.10 | 1.3 | |
| CVfolds=5, re-trained_on_full_dataset=true2022.10 | 1.19 |