ResearchBenchmarksOffline Reinforcement Learning on Hopper Medium-Expert (Noise 0)Follow111.71Normalized ReturnI-TAP55.227669.891384.55599.2187Feb 21, 2026Evaluation ResultsMethodMethodLinksNormalized ReturnI-TAPModel Category=Model-B...Model Category=Model-Based2026.02111.71L-MAPModel Category=Model-B...Model Category=Model-Based2026.02106.74CQLModel Category=Model-FreeModel Category=Model-Free2026.02105.4DTModel Category=Model-FreeModel Category=Model-Free2026.02101.6IQLModel Category=Model-FreeModel Category=Model-Free2026.0291.5TAPModel Category=Model-B...Model Category=Model-Based2026.0285.551R2RModel Category=Model-B...Model Category=Model-Based2026.0257.4