Offline-to-Online Reinforcement Learning on D4RL 6 environments min-max normalized (averaged)
0.031Normalized RegretSMAC
Evaluation Results
| Method | Links | |
|---|---|---|
| SMACOnline Algorithm=SAC2026.02 | 0.031 | |
| SMACOnline Algorithm=TD32026.02 | 0.09 | |
| SMACOnline Algorithm=TD3+BC2026.02 | 0.226 | |
| SMACOnline Algorithm=AWR2026.02 | 0.38 | |
| CalQL/CQLOnline Algorithm=TD32026.02 | 0.442 | |
| CalQL/CQLOnline Algorithm=SAC2026.02 | 0.448 | |
| IQLOnline Algorithm=SAC2026.02 | 0.471 | |
| CalQL/CQLOnline Algorithm=AWR2026.02 | 0.482 | |
| IQLOnline Algorithm=TD3+BC2026.02 | 0.494 | |
| IQLOnline Algorithm=AWR2026.02 | 0.508 | |
| TD3+BCOnline Algorithm=TD32026.02 | 0.545 | |
| TD3+BCOnline Algorithm=TD3+BC2026.02 | 0.562 | |
| CalQL/CQLOnline Algorithm=TD3+BC2026.02 | 0.614 | |
| IQLOnline Algorithm=TD32026.02 | 0.653 | |
| TD3+BCOnline Algorithm=AWR2026.02 | 0.654 | |
| TD3+BCOnline Algorithm=SAC2026.02 | 0.962 |