ResearchBenchmarksOffline Reinforcement Learning on D4RL Maze2D Large v1Follow50.3Avg Normalized ReturnGAC-4.62249.636323.89538.1537Dec 25, 2025Evaluation ResultsMethodMethodLinksAvg Normalized ReturnGACStrategy=Exploitation...Strategy=Exploitation query (GAC-E[y])2025.1250.3GACStrategy=Exploration q...Strategy=Exploration query (GAC-p(y+))2025.1239.5LPT2025.1237.2GACStrategy=Fixed target...Strategy=Fixed target steering (GAC-y*)2025.1228.9IQL2025.122GACStrategy=Sampling from...Strategy=Sampling from prior (p(y|z)p(z))2025.12-0.4CQL2025.12-1.2DT2025.12-2.5QDT2025.12-2.51