ResearchBenchmarksReinforcement Learning on AntMaze large-diverse offline-to-onlineFollow90.4ScoreRLPD59.267.375.483.5May 14, 2026Evaluation ResultsMethodMethodLinksScoreRLPDEvaluation Setting=off...Evaluation Setting=offline-to-online2026.0590.4CPQLEvaluation Setting=off...Evaluation Setting=offline-to-online2026.0582Cal-QLEvaluation Setting=off...Evaluation Setting=offline-to-online2026.0574.4CQLEvaluation Setting=off...Evaluation Setting=offline-to-online2026.0565.3PEXEvaluation Setting=off...Evaluation Setting=offline-to-online2026.0560.4