ResearchBenchmarksOffline-to-online Reinforcement Learning on D4RL antmaze-medium-diverseFollow81.7OSRCal-QL-3.26818.79140.8562.909May 11, 2026Evaluation ResultsMethodMethodLinksOSRSuccess RateCal-QL2026.0581.795.8CQLvariant=+SACvariant=+SAC2026.0578.398.3RankQvariant=+SACvariant=+SAC2026.0578.396.7Cal-QLvariant=+SACvariant=+SAC2026.0571.796.9CQL2026.0566.798.1RankQ2026.0566.796.2SACvariant=+OFFvariant=+OFF2026.0511.796.6Hybrid RL2026.051.797.1SAC2026.0500