ResearchBenchmarksInverse Reinforcement Learning on MuJoCo HopperFollow81Normalized ReturnTRIRL5561.7568.575.25May 10, 2026Evaluation ResultsMethodMethodLinksNormalized ReturnTRIRLOptimization Objective...Optimization Objective=max η2026.0581TRIRLOptimization Objective...Optimization Objective=TR loss2026.0556SFMDynamics Model=forward...Dynamics Model=forward dynamics model (FDM), Policy Architecture=TD72026.0556