Offline-to-Online Reinforcement Learning on relocate cloned v1
0.44Average Online Expected ReturnDUAL
Evaluation Results
| Method | Links | |
|---|---|---|
| DUALCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 0.44 | |
| Diff-QLCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 0.23 | |
| EDISCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 0.14 | |
| BaseCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 0.1 | |
| DUALCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.12 | |
| EDISCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.24 | |
| Diff-QLCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.26 | |
| BaseCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.28 |