Offline-to-Online Reinforcement Learning on pen-cloned v1
124.4Avg Online ReturnDUAL
Evaluation Results
| Method | Links | |
|---|---|---|
| DUALCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 124.4 | |
| Diff-QLCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 104.45 | |
| EDISCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 97.31 | |
| BaseCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 94.74 | |
| DUALCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -1.09 | |
| Diff-QLCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -1.93 | |
| EDISCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -2.23 | |
| BaseCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -2.69 |