Offline-to-online Reinforcement Learning on D4RL Hopper expert discretized
47.1Online Normalised ScoreDRIFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DRIFTdiscretisation=k-means, k=22, seeds=52026.05 | 47.1 | 0.4 | |
| PEXdiscretisation=k-means, k=22, seeds=52026.05 | 39.5 | 0.1 | |
| CQLdiscretisation=k-means, k=22, seeds=52026.05 | 29.3 | 8.8 | |
| Cal-QLdiscretisation=k-means, k=22, seeds=52026.05 | 25.7 | 8.8 | |
| DQNdiscretisation=k-means, k=22, seeds=52026.05 | 21.7 | 0.3 | |
| IQLdiscretisation=k-means, k=22, seeds=52026.05 | 17.2 | 0.1 | |
| AWACdiscretisation=k-means, k=22, seeds=52026.05 | 11.2 | 11.5 | |
| PPOdiscretisation=k-means, k=22, seeds=52026.05 | 3.7 | — | |
| SPAdiscretisation=k-means, k=22, seeds=52026.05 | 0.3 | 0.3 |