ResearchBenchmarksSafe Reinforcement Learning on double-gates+ Double Integrator dynamicsFollow0Mean Safety Violations per EpisodeTD3-0.261.4953.255.005May 22, 2024Evaluation ResultsMethodMethodLinksMean Safety Violations per EpisodeMean Shield Invocations per EpisodeSD Shield Invocations per EpisodeSD Safety Violations per EpisodeTD32024.050——0CPO2024.052.9——1PPO-lag2024.056.5——4.5DMPS2024.05—24.26.4—MPS2024.05—239.816.3—