Offline-to-Online Reinforcement Learning on D4RL AntMaze (UMaze & Medium Configurations)
98.7UMaze Success RateCal-QL
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Cal-QL2026.07 | 98.7 | — | 47.3 | 0 | 28 | 43.5 | |
| Loss Smoothing2026.07 | 80 | — | 76 | 83.3 | 94 | 83.3 | |
| OPT2026.07 | 44 | — | 81.3 | 84 | 68 | 69.3 | |
| Hard-Switch2026.07 | 40.7 | — | 67.7 | 55.7 | 21.7 | 46.4 | |
| Offline2026.07 | 26 | — | 18 | 58 | 38 | 35 | |
| AWAC2026.07 | 6.7 | — | 14.7 | 0 | 0 | 5.3 | |
| Online2026.07 | 0 | — | 0 | 0 | 0 | 0 |