ResearchBenchmarksSafe Reinforcement Learning on double-gates Differential Drive dynamicsFollow3Mean Safety Violations per EpisodeTD32.8044.1275.456.773May 22, 2024Evaluation ResultsMethodMethodLinksMean Safety Violations per EpisodeMean Shield Invocations per EpisodeSD Shield Invocations per EpisodeSD Safety Violations per EpisodeTD32024.053——5.5CPO2024.053.9——1.7PPO-lag2024.057.9——9.2DMPS2024.05—5.51.9—MPS2024.05—52.517.6—