ResearchBenchmarksSafe Reinforcement Learning on double-gates+ Differential Drive dynamicsFollow0.2Mean Safety Violations per EpisodeTD3-0.2762.9376.159.363May 22, 2024Evaluation ResultsMethodMethodLinksMean Safety Violations per EpisodeMean Shield Invocations per EpisodeSD Shield Invocations per EpisodeSD Safety Violations per EpisodeTD32024.050.2——0.4PPO-lag2024.056.9——6.1CPO2024.0512.1——2.9DMPS2024.05—18.413—MPS2024.05—106.218.5—