ResearchBenchmarksReinforcement Learning on Antmaze large diverseFollow25OSRCal-QL-15.7512.519.25May 11, 2026Evaluation ResultsMethodMethodLinksOSRSuccess RateCal-QLvariant=+SACvariant=+SAC2026.05250CQLvariant=+SACvariant=+SAC2026.0523.30.1RankQ2026.0521.784.7RankQvariant=+SACvariant=+SAC2026.0521.70Cal-QL2026.0518.374CQL2026.051021Hybrid RL2026.0500SAC2026.0500SACvariant=+OFFvariant=+OFF2026.0500.1