ResearchBenchmarksInverse Reinforcement Learning on MuJoCo HumanoidFollow0.92Normalized ReturnTRIRL0.69120.75060.810.8694May 10, 2026Evaluation ResultsMethodMethodLinksNormalized ReturnTRIRLOptimization Objective...Optimization Objective=max η2026.050.92TRIRLOptimization Objective...Optimization Objective=TR loss2026.050.78SFMDynamics Model=forward...Dynamics Model=forward dynamics model (FDM), Policy Architecture=TD72026.050.7