Offline Reinforcement Learning on Robomimic Transport
0.74Average True ReturnOptimal Policy
Evaluation Results
| Method | Links | |
|---|---|---|
| Optimal Policy2022.10 | 0.74 | |
| SSR-RRSrepeats=5, re-trained_on_full_dataset=true2022.10 | 0.7 | |
| SSR-RRSrepeats=2, re-trained_on_full_dataset=true2022.10 | 0.62 | |
| CVfolds=2, re-trained_on_full_dataset=true2022.10 | 0.42 | |
| CVfolds=5, re-trained_on_full_dataset=true2022.10 | 0.42 | |
| BVFT-FQEvariant=pi x FQE, re-trained_on_full_dataset=true2022.10 | 0.21 | |
| BVFT-FQEvariant=pi + FQE, re-trained_on_full_dataset=true2022.10 | 0 |