Offline-to-online Reinforcement Learning on D4RL Walker expert discretized
14.8Online Normalized ScoreDRIFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DRIFTdiscretisation=k-means, k=22, seeds=52026.05 | 14.8 | 0.1 | |
| Cal-QLdiscretisation=k-means, k=22, seeds=52026.05 | 12.4 | 4 | |
| CQLdiscretisation=k-means, k=22, seeds=52026.05 | 10.7 | 4 | |
| IQLdiscretisation=k-means, k=22, seeds=52026.05 | 10.1 | 0.2 | |
| AWACdiscretisation=k-means, k=22, seeds=52026.05 | 9 | 9.4 | |
| PEXdiscretisation=k-means, k=22, seeds=52026.05 | 7.2 | 0.2 | |
| PPOdiscretisation=k-means, k=22, seeds=52026.05 | 7 | — | |
| DQNdiscretisation=k-means, k=22, seeds=52026.05 | 6.5 | 0.2 | |
| SPAdiscretisation=k-means, k=22, seeds=52026.05 | 0.2 | 0.2 |