ResearchBenchmarksSafe Reinforcement Learning on dynamic-obst Double Integrator dynamicsFollow0.8Mean Safety Violations / EpisodeTD30.6881.4442.22.956May 22, 2024Evaluation ResultsMethodMethodLinksMean Safety Violations / EpisodeMean Shield Invocations / EpisodeSD Shield Invocations / EpisodeSD Safety Violations / EpisodeTD32024.050.8——1.2CPO2024.051.7——0.8PPO-lag2024.053.6——3.9DMPS2024.05—9.31.8—MPS2024.05—144.126.2—