Offline Reinforcement Learning on Sepsis MDP n=200
-1.94Average True ReturnOptimal Policy
Evaluation Results
| Method | Links | |
|---|---|---|
| Optimal Policy2022.10 | -1.94 | |
| SSR-RRSrepeats=5, re-trained_on_full_dataset=true2022.10 | -7.85 | |
| CVfolds=2, re-trained_on_full_dataset=true2022.10 | -10.26 | |
| SSR-RRSrepeats=2, re-trained_on_full_dataset=true2022.10 | -13.01 | |
| BVFT-FQEvariant=pi + FQE, re-trained_on_full_dataset=true2022.10 | -19.32 | |
| CVfolds=5, re-trained_on_full_dataset=true2022.10 | -20.32 |