Offline Reinforcement Learning on D4RL Maze2D Medium
152Normalized PerformanceDQL*
Evaluation Results
| Method | Links | |
|---|---|---|
| DQL*Method Category=Diffusion Policies2026.03 | 152 | |
| SAGEMethod Category=Diffusion Planners2026.03 | 150.8 | |
| DV*Method Category=Diffusion Planners2026.03 | 150.7 | |
| DRIVESeeds=52026.06 | 136.8 | |
| LoMAPMethod Category=Diffusion Planners2026.03 | 131 | |
| RGGMethod Category=Diffusion Planners2026.03 | 130 | |
| LDCQMethod Category=Diffusion Planners2026.03 | 125.3 | |
| Diffuser*Method Category=Diffusion Planners2026.03 | 121.5 | |
| IDQL*Method Category=Diffusion Policies2026.03 | 89.5 | |
| TD3+BCSeeds=52026.06 | 62.1 | |
| PDiTSeeds=52026.06 | 51.2 | |
| CQLSeeds=52026.06 | 41.8 | |
| DTSeeds=52026.06 | 37 | |
| IQLMethod Category=Non-Diffusion2026.03 | 34.9 | |
| IQLSeeds=52026.06 | 34.9 | |
| BCMethod Category=IL2026.03 | 30.3 | |
| BEARSeeds=52026.06 | 25 | |
| BCSeeds=52026.06 | 20.1 | |
| BCQMethod Category=Non-Diffusion2026.03 | 8.3 | |
| CQLMethod Category=Non-Diffusion2026.03 | 5 | |
| DyDiffBase Policy=DiffQL2024.05 | 1.67 | |
| DyDiffBase Policy=CQL2024.05 | 1.39 | |
| DyDiffBase Policy=TD3BC2024.05 | 1 | |
| CQLAugmentation=None2024.05 | 0.93 | |
| SynthERBase Policy=CQL2024.05 | 0.92 | |
| TD3BCAugmentation=None2024.05 | 0.81 | |
| DiffQLAugmentation=None2024.05 | 0.5 | |
| SynthERBase Policy=TD3BC2024.05 | 0.49 | |
| SynthERBase Policy=DiffQL2024.05 | 0.17 |