Offline Reinforcement Learning on Sepsis POMDP (n=1000)
7.86Average True ReturnOptimal Policy
Evaluation Results
| Method | Links | |
|---|---|---|
| Optimal Policy2022.10 | 7.86 | |
| SSR-RRSrepeats=5, re-trained_on_full_dataset=true2022.10 | 6.75 | |
| SSR-RRSrepeats=2, re-trained_on_full_dataset=true2022.10 | 2.4 | |
| CVfolds=2, re-trained_on_full_dataset=true2022.10 | 0.74 | |
| BVFT-FQEvariant=pi + FQE, re-trained_on_full_dataset=true2022.10 | -1.92 | |
| CVfolds=5, re-trained_on_full_dataset=true2022.10 | -1.92 |