ResearchBenchmarksOffline Reinforcement Learning on Hopper randomFollow32.2Normalized ScoreAnti-exploration Method-0.1448.25316.6525.047Dec 2, 2025Dec 13, 2025Dec 24, 2025Jan 5, 2026Jan 16, 2026Jan 27, 2026Feb 8, 2026Evaluation ResultsMethodMethodLinksNormalized ScoreAnti-exploration Method2026.0232.2GPC-SAC2026.0231.4SAC-RND2026.0231.3DMG2026.0220.4CQL2026.0216.4TD3-CVAE2026.0211.7IQL2026.027.8OTDF2025.124.4IGDF2025.124.1DVDF-OTDF2025.124DVDF-IGDF2025.123.8IQL2025.123.7DARA2025.123.4BOSA2025.121.1