Offline-to-Online Reinforcement Learning on Adroit Average
46.71Average Online ReturnDUAL
Evaluation Results
| Method | Links | |
|---|---|---|
| DUALCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 46.71 | |
| Diff-QLCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 37.5125 | |
| EDISCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 33.9775 | |
| BaseCritic framework=IQL, Online training time steps=1M, Random seeds=52026.05 | 33.01 | |
| DUALCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.2025 | |
| Diff-QLCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.545 | |
| EDISCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.61 | |
| BaseCritic framework=Cal-QL, Online training time steps=1M, Random seeds=52026.05 | -0.76 |