ResearchBenchmarksReinforcement Learning on LunarLander v2 (Convergence Rate)Follow750Episodes to Target RewardPPO740.36805.43870.5935.57Apr 24, 2026Evaluation ResultsMethodMethodLinksEpisodes to Target RewardImprovement FactorPPOReward normalization m...Reward normalization method=K-Score, Base algorithm=PPO2026.047501.32PPOReward normalization m...Reward normalization method=Z-Score, Base algorithm=PPO2026.04991—