Offline-to-Online Reinforcement Learning on door-cloned v1
15.26Average Online ReturnDUAL
Evaluation Results
| Method | Links | |
|---|---|---|
| DUALCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 15.26 | |
| Diff-QLCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 11.55 | |
| EDISCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 10.46 | |
| BaseCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 9.79 | |
| DUALCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.28 | |
| Diff-QLCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.31 | |
| EDISCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.32 | |
| BaseCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.33 |