Offline-to-Online Reinforcement Learning on D4RL Adroit
121.8Pen ScoreOPT
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| OPT2026.07 | 121.8 | — | 112.9 | 72.1 | 0.3 | 76.8 | |
| Loss Smoothing2026.07 | 118.2 | — | 122.1 | 63.4 | -0.1 | 75.9 | |
| Hard-Switch2026.07 | 114.9 | — | 117.3 | 0.3 | -0.1 | 58.1 | |
| Cal-QL2026.07 | 103 | — | 120.9 | 19.9 | -0.2 | 60.9 | |
| Online2026.07 | 101.6 | — | 100.5 | 58.3 | -0.1 | 65.1 | |
| AWAC2026.07 | 55.3 | — | 0.3 | -0.1 | -0.2 | 13.8 | |
| Offline2026.07 | 47.8 | — | 2.2 | 0.3 | 0 | 12.6 |