Offline-to-online Reinforcement Learning on D4RL walker2d-m
118.3Final Online ScoreDiffusion-QL
Evaluation Results
| Method | Links | |
|---|---|---|
| Diffusion-QL2026.05 | 118.3 | |
| Consistency-AC2026.05 | 108.9 | |
| MoMa QL2026.05 | 99.1 | |
| SAC2026.05 | 79.6 | |
| ACA2026.05 | 74.7 | |
| AWAC2026.05 | 1.9 |
| Method | Links | |
|---|---|---|
| Diffusion-QL2026.05 | 118.3 | |
| Consistency-AC2026.05 | 108.9 | |
| MoMa QL2026.05 | 99.1 | |
| SAC2026.05 | 79.6 | |
| ACA2026.05 | 74.7 | |
| AWAC2026.05 | 1.9 |