Offline Reinforcement Learning on D4RL Maze2D Umaze
140.6Normalized Performance ScoreDQL*
Evaluation Results
| Method | Links | |
|---|---|---|
| DQL*Method Category=Diffusion Policies2026.03 | 140.6 | |
| SAGEMethod Category=Diffusion Planners2026.03 | 137.9 | |
| DV*Method Category=Diffusion Planners2026.03 | 136.8 | |
| LDCQMethod Category=Diffusion Planners2026.03 | 134.2 | |
| RGGMethod Category=Diffusion Planners2026.03 | 128.3 | |
| LoMAPMethod Category=Diffusion Planners2026.03 | 126 | |
| Diffuser*Method Category=Diffusion Planners2026.03 | 113.9 | |
| CQLSeeds=52026.06 | 94.7 | |
| PDiTSeeds=52026.06 | 73.2 | |
| BEARSeeds=52026.06 | 65.7 | |
| DTSeeds=52026.06 | 60.3 | |
| IDQL*Method Category=Diffusion Policies2026.03 | 57.9 | |
| DRIVESeeds=52026.06 | 56.3 | |
| IQLMethod Category=Non-Diffusion2026.03 | 47.4 | |
| IQLSeeds=52026.06 | 42.1 | |
| BCSeeds=52026.06 | 16.4 | |
| TD3+BCSeeds=52026.06 | 14.8 | |
| BCQMethod Category=Non-Diffusion2026.03 | 12.8 | |
| CQLMethod Category=Non-Diffusion2026.03 | 5.7 | |
| BCMethod Category=IL2026.03 | 3.8 |