Offline-to-online Reinforcement Learning on relocate
62.8RegretSMAC
Evaluation Results
| Method | Links | |
|---|---|---|
| SMACOffline Algorithm=SMAC, Fine-tuning algorithm=SAC2026.02 | 62.8 | |
| SMACFine-tuning algorithm=TD3+BC, Offline Algorithm=SMAC2026.02 | 84.9 | |
| IQLFine-tuning algorithm=TD3+BC, Offline Algorithm=IQL2026.02 | 95.3 | |
| IQLOffline Algorithm=IQL, Fine-tuning algorithm=AWR2026.02 | 95.8 | |
| IQLOffline Algorithm=IQL, Fine-tuning algorithm=SAC2026.02 | 97.4 | |
| CalQL/CQLOffline Algorithm=CalQL/CQL, Fine-tuning algorithm=SAC2026.02 | 98.1 | |
| TD3+BCOffline Algorithm=TD3+BC, Fine-tuning algorithm=AWR2026.02 | 98.1 | |
| TD3+BCFine-tuning algorithm=TD3+BC, Offline Algorithm=TD3+BC2026.02 | 98.2 | |
| SMACOffline Algorithm=SMAC, Fine-tuning algorithm=AWR2026.02 | 98.3 | |
| CalQL/CQLOffline Algorithm=CalQL/CQL, Fine-tuning algorithm=AWR2026.02 | 99 | |
| CalQL/CQLFine-tuning algorithm=TD3+BC, Offline Algorithm=CalQL/CQL2026.02 | 99.1 | |
| TD3+BCOffline Algorithm=TD3+BC, Fine-tuning algorithm=SAC2026.02 | 99.2 |