ResearchBenchmarksOffline Reinforcement Learning on D4RL hopper-medium-replay v2 (test)Follow9,600Normalized RewardVDT-321.62,254.24,8307,405.8Jan 22, 2026Evaluation ResultsMethodMethodLinksNormalized RewardVDT2026.019,600IQL2026.019,470LSDT2026.019,390DDT2026.019,250DT2026.018,310TD3+BC2026.016,090CQL2026.014,860BRAC-v2026.0160