Offline-to-online Reinforcement Learning on D4RL Cheetah medium discretized
16.9Online ScoreDQN
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DQNdiscretisation=k-means, k=22, seeds=52026.05 | 16.9 | 2.1 | |
| CQLdiscretisation=k-means, k=22, seeds=52026.05 | 15.8 | 3.3 | |
| Cal-QLdiscretisation=k-means, k=22, seeds=52026.05 | 15.8 | 3.3 | |
| PEXdiscretisation=k-means, k=22, seeds=52026.05 | 14.6 | 0.2 | |
| AWACdiscretisation=k-means, k=22, seeds=52026.05 | 12.7 | 13.1 | |
| DRIFTdiscretisation=k-means, k=22, seeds=52026.05 | 11.1 | 0.2 | |
| IQLdiscretisation=k-means, k=22, seeds=52026.05 | 7.8 | 0.2 | |
| PPOdiscretisation=k-means, k=22, seeds=52026.05 | 4.9 | — | |
| SPAdiscretisation=k-means, k=22, seeds=52026.05 | 2.1 | 2.1 |