ResearchBenchmarksReinforcement Learning on QuadrotorFollow127,680Episode Steps (Mean)PPO42,403.1264,542.3186,681.5108,820.69Jun 2, 2025Evaluation ResultsMethodMethodLinksEpisode Steps (Mean)Episode Steps (95% CI)Final Return (Mean)Final Return (95% CI)Stuck CountPPOSafeguard=RMSafeguard=RM2025.06127,680107,520-379-4190PPOSafeguard=BPSafeguard=BP2025.06118,72089,600-402-4530SACSafeguard=BPSafeguard=BP2025.06110,17690,131-338-3680SACSafeguard=RMSafeguard=RM2025.0680,12859,081-377-4150SHACSafeguard=RMSafeguard=RM2025.0667,14831,909-251-3070SHACSafeguard=BPSafeguard=BP2025.0645,68316,498-333-3940