ResearchBenchmarksOffline-to-online Reinforcement Learning on D4RL antmaze-medium-playFollow81.7OSRCQL-3.26818.79140.8562.909May 11, 2026Evaluation ResultsMethodMethodLinksOSRSRCQL2026.0581.798RankQvariant=+SACvariant=+SAC2026.0581.798.7CQLvariant=+SACvariant=+SAC2026.0578.398.3Cal-QLvariant=+SACvariant=+SAC2026.057598.9RankQ2026.057597.7Cal-QL2026.0571.797.8Hybrid RL2026.0513.398.3SACvariant=+OFFvariant=+OFF2026.0511.798.8SAC2026.0500