Offline-to-online Reinforcement Learning on D4RL hopper (Regret)
293.7RegretCalQL/CQL
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| CalQL/CQLOffline Algorithm=CalQL/CQL, Fine-tuning algorithm=SAC2026.02 | 293.7 | — | — | — | — | — | |
| SMACOffline Algorithm=SMAC, Fine-tuning algorithm=SAC2026.02 | 386.3 | — | — | — | — | — | |
| IQLOffline Algorithm=IQL, Fine-tuning algorithm=SAC2026.02 | 798 | — | — | — | — | — | |
| TD3+BCOffline Algorithm=TD3+BC, Fine-tuning algorithm=SAC2026.02 | 3,213.3 | — | — | — | — | — | |
| ROADMixing Ratio Strategy=ROAD, Algorithm=IQL2026.05 | — | 31.77 | 99.14 | 99.23 | 94.08 | 85.1 | |
| UniformMixing Ratio Strategy=Uniform, Algorithm=IQL2026.05 | — | 13.77 | 97.93 | 86.17 | 66.02 | 50.81 |