Offline-to-online Reinforcement Learning on D4RL Hopper medium discretized
47.9Online Normalized ScoreDRIFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DRIFTdiscretisation=k-means, k=22, seeds=52026.05 | 47.9 | 0.1 | |
| Cal-QLdiscretisation=k-means, k=22, seeds=52026.05 | 44.1 | 28.8 | |
| PEXdiscretisation=k-means, k=22, seeds=52026.05 | 43.1 | 0.4 | |
| CQLdiscretisation=k-means, k=22, seeds=52026.05 | 35.8 | 28.8 | |
| IQLdiscretisation=k-means, k=22, seeds=52026.05 | 27.9 | 0.4 | |
| AWACdiscretisation=k-means, k=22, seeds=52026.05 | 25.3 | 26 | |
| DQNdiscretisation=k-means, k=22, seeds=52026.05 | 23.7 | 0.4 | |
| PPOdiscretisation=k-means, k=22, seeds=52026.05 | 3.1 | — | |
| SPAdiscretisation=k-means, k=22, seeds=52026.05 | 0.4 | 0.4 |