ResearchBenchmarksOffline Reinforcement Learning on D4RL Maze maze2d-umaze v2 (test)Follow13,330Normalized ScoreA2PO-2,134.81,880.15,8959,909.9Mar 12, 2024Evaluation ResultsMethodMethodLinksNormalized ScoreA2PO2024.0313,330AWAC2024.039,450LAPO2024.037,800Diffusion-QL2024.036,670EQL2024.035,650IQL2024.035,620BCQ2024.032,480TD3+BC2024.032,420CQL+AW2024.031,960CQL2024.03570BC2024.0350MOPO2024.03-1,540