ResearchBenchmarksReinforcement Learning on AntMaze Large PlayFollow46.7OSRRankQ-1.86810.74123.3535.959May 11, 2026Evaluation ResultsMethodMethodLinksOSRSRRankQvariant=+SACvariant=+SAC2026.0546.70CQLvariant=+SACvariant=+SAC2026.0543.30Cal-QL2026.0536.767.7RankQ2026.0536.791.2Cal-QLvariant=+SACvariant=+SAC2026.05300CQL2026.0528.382.8Hybrid RL2026.0500SAC2026.0500SACvariant=+OFFvariant=+OFF2026.0500