Offline-to-online Reinforcement Learning on D4RL halfcheetah-m
99.6Final Online ScoreDiffusion-QL
Evaluation Results
| Method | Links | |
|---|---|---|
| Diffusion-QL2026.05 | 99.6 | |
| Consistency-AC2026.05 | 98.7 | |
| MoMa QL2026.05 | 83.1 | |
| SAC2026.05 | 75.2 | |
| ACA2026.05 | 66.6 | |
| AWAC2026.05 | 50.5 |