ResearchBenchmarksOffline Reinforcement Learning on D4RL hopper-medium-expert v2 (test)Follow11,170Normalized RewardLSDT-363.62,630.75,6258,619.3Jan 22, 2026Evaluation ResultsMethodMethodLinksNormalized RewardLSDT2026.0111,170VDT2026.0111,150DDT2026.0111,110CQL2026.0111,100DT2026.0110,680TD3+BC2026.019,800IQL2026.019,150BRAC-v2026.0180