ResearchBenchmarksOffline Reinforcement Learning on D4RL Maze2D Medium v1Follow74.5Average Normalized ReturnGAC-6.72414.36335.4556.537Dec 25, 2025Evaluation ResultsMethodMethodLinksAverage Normalized ReturnGACStrategy=Exploitation...Strategy=Exploitation query (GAC-E[y])2025.1274.5GACStrategy=Exploration q...Strategy=Exploration query (GAC-p(y+))2025.1263.3GACStrategy=Fixed target...Strategy=Fixed target steering (GAC-y*)2025.1261.2LPT2025.1220.6GACStrategy=Sampling from...Strategy=Sampling from prior (p(y|z)p(z))2025.1219.9IQL2025.123.5DT2025.12-2.4QDT2025.12-2.58CQL2025.12-3.6