ResearchBenchmarksSafe Reinforcement Learning on Swimmer Velocity tasks suiteFollow36.32Average RewardADRC28.41630.46832.5234.572Jan 26, 2026Evaluation ResultsMethodMethodLinksAverage RewardAverage CostViolation RateADRCBase RL Algorithm=TRPOBase RL Algorithm=TRPO2026.0136.3219.0312.16PIDBase RL Algorithm=CPPOBase RL Algorithm=CPPO2026.0130.122.4428.02ADRCBase RL Algorithm=CPPOBase RL Algorithm=CPPO2026.0129.3916.7714.16PIDBase RL Algorithm=TRPOBase RL Algorithm=TRPO2026.0128.7221.3437.85