Offline-to-Online Reinforcement Learning on hammer-cloned v1
46.74Average Online Expected ReturnDUAL
Evaluation Results
| Method | Links | |
|---|---|---|
| DUALCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 46.74 | |
| Diff-QLCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 33.82 | |
| EDISCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 28 | |
| BaseCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 27.41 | |
| DUALCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | 0.68 | |
| EDISCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | 0.35 | |
| Diff-QLCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | 0.32 | |
| BaseCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | 0.26 |