Offline-to-online Reinforcement Learning on D4RL Walker medium discretized
15.9Online Normalised ScoreDRIFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DRIFTdiscretisation=k-means, k=22, seeds=52026.05 | 15.9 | 1 | |
| IQLdiscretisation=k-means, k=22, seeds=52026.05 | 13 | 0.3 | |
| CQLdiscretisation=k-means, k=22, seeds=52026.05 | 12.6 | 2.5 | |
| DQNdiscretisation=k-means, k=22, seeds=52026.05 | 12.3 | 1.8 | |
| PEXdiscretisation=k-means, k=22, seeds=52026.05 | 11.8 | 0.3 | |
| Cal-QLdiscretisation=k-means, k=22, seeds=52026.05 | 11.7 | 2.5 | |
| PPOdiscretisation=k-means, k=22, seeds=52026.05 | 7.2 | — | |
| AWACdiscretisation=k-means, k=22, seeds=52026.05 | 5.8 | 4.2 | |
| SPAdiscretisation=k-means, k=22, seeds=52026.05 | 1.8 | 1.8 |