ResearchBenchmarksSafe Reinforcement Learning on double-gates Double Integrator dynamicsFollow0.3Mean Safety Violations per EpisodeTD3-0.162.9456.059.155May 22, 2024Evaluation ResultsMethodMethodLinksMean Safety Violations per EpisodeMean Shield Invocations per EpisodeSD Shield Invocations per EpisodeSD Safety Violations per EpisodeTD32024.050.3——0.5CPO2024.052.1——1.7PPO-lag2024.0511.8——6.3DMPS2024.05—4.51.2—MPS2024.05—28.36.9—