ResearchBenchmarksOffline Reinforcement Learning on Mean MediumFollow71.33Normalized ReturnI-TAP50.030855.560461.0966.6196Feb 21, 2026Evaluation ResultsMethodMethodLinksNormalized ReturnI-TAPModel Category=Model-B...Model Category=Model-Based2026.0271.33L-MAPModel Category=Model-B...Model Category=Model-Based2026.0263.46IQLModel Category=Model-FreeModel Category=Model-Free2026.0257.77CQLModel Category=Model-FreeModel Category=Model-Free2026.0256.081R2RModel Category=Model-B...Model Category=Model-Based2026.0251.28DTModel Category=Model-FreeModel Category=Model-Free2026.0251.06TAPModel Category=Model-B...Model Category=Model-Based2026.0250.85