ResearchBenchmarksReinforcement Learning on Gymnasium Walker2d v4 (train)Follow5,042.9Final ReturnReflex2,631.3483,257.4243,883.54,509.576May 22, 2026Evaluation ResultsMethodMethodLinksFinal ReturnPercentage ImprovementSteps to BaselineReflexBase Algorithm=SACBase Algorithm=SAC2026.055,042.9120.44SACBase Algorithm=SACBase Algorithm=SAC2026.054,488—1ReflexBase Algorithm=PPOBase Algorithm=PPO2026.053,672.5350.41PPOBase Algorithm=PPOBase Algorithm=PPO2026.052,724.1—1