Offline-to-online Reinforcement Learning on D4RL Cheetah expert discretized
9.7Online Normalized ScoreDRIFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DRIFTdiscretisation=k-means, k=22, seeds=52026.05 | 9.7 | 0.5 | |
| CQLdiscretisation=k-means, k=22, seeds=52026.05 | 8.6 | 0.7 | |
| Cal-QLdiscretisation=k-means, k=22, seeds=52026.05 | 8.5 | 0.7 | |
| PEXdiscretisation=k-means, k=22, seeds=52026.05 | 7.7 | 0.2 | |
| IQLdiscretisation=k-means, k=22, seeds=52026.05 | 6.8 | 0.2 | |
| PPOdiscretisation=k-means, k=22, seeds=52026.05 | 5.9 | — | |
| DQNdiscretisation=k-means, k=22, seeds=52026.05 | 4.7 | 0.1 | |
| AWACdiscretisation=k-means, k=22, seeds=52026.05 | 1 | 1.1 | |
| SPAdiscretisation=k-means, k=22, seeds=52026.05 | 0.1 | 0.1 |