Offline-to-online Reinforcement Learning on D4RL hopper-m
104.3Final Online ScoreMoMa QL
Evaluation Results
| Method | Links | |
|---|---|---|
| MoMa QL2026.05 | 104.3 | |
| AWAC2026.05 | 97.5 | |
| ACA2026.05 | 96.5 | |
| Diffusion-QL2026.05 | 77.2 | |
| SAC2026.05 | 73.4 | |
| Consistency-AC2026.05 | 60.5 |
| Method | Links | |
|---|---|---|
| MoMa QL2026.05 | 104.3 | |
| AWAC2026.05 | 97.5 | |
| ACA2026.05 | 96.5 | |
| Diffusion-QL2026.05 | 77.2 | |
| SAC2026.05 | 73.4 | |
| Consistency-AC2026.05 | 60.5 |