Offline Reinforcement Learning on Robomimic Can-Paired
75Avg True ReturnOptimal Policy
Evaluation Results
| Method | Links | |
|---|---|---|
| Optimal Policy2022.10 | 75 | |
| SSR-RRSrepeats=5, re-trained_on_full_dataset=true2022.10 | 73 | |
| CVfolds=2, re-trained_on_full_dataset=true2022.10 | 72 | |
| CVfolds=5, re-trained_on_full_dataset=true2022.10 | 72 | |
| BVFT-FQEvariant=pi + FQE, re-trained_on_full_dataset=true2022.10 | 71 | |
| SSR-RRSrepeats=2, re-trained_on_full_dataset=true2022.10 | 71 | |
| BVFT-FQEvariant=pi x FQE, re-trained_on_full_dataset=true2022.10 | 65 |