ResearchBenchmarksReinforcement Learning on LunarLander v3 (Coefficient of Variation)Follow3.2Coefficient of VariationTD32.8085.4548.110.746Mar 12, 2026Evaluation ResultsMethodMethodLinksCoefficient of VariationTD3Variant=H-EARSVariant=H-EARS2026.033.2TD3Variant=VanillaVariant=Vanilla2026.035.4PPOVariant=H-EARSVariant=H-EARS2026.035.4SACVariant=H-EARSVariant=H-EARS2026.036.6DDPGVariant=H-EARSVariant=H-EARS2026.038.4PPOVariant=VanillaVariant=Vanilla2026.0310.2SACVariant=VanillaVariant=Vanilla2026.0311.2DDPGVariant=VanillaVariant=Vanilla2026.0313