ResearchBenchmarksSafe Reinforcement Learning on Circle (offline)Follow1.27Normalized RewardTask-Only0.88520.98511.0851.1849May 20, 2026Evaluation ResultsMethodMethodLinksNormalized RewardNormalized CostTask-OnlyAlgorithm=Task-OnlyAlgorithm=Task-Only2026.051.271RCAlgorithm=Reward Combi...Algorithm=Reward Combination, Safety trade-off weight (ω)=0.52026.051.090SOPLAlgorithm=Safety-Only...Algorithm=Safety-Only Preference Learning2026.051.040OracleAlgorithm=OracleAlgorithm=Oracle2026.0510Safe-CPLAlgorithm=Safe-CPLAlgorithm=Safe-CPL2026.050.910Safe-VPLAlgorithm=Safe-VPLAlgorithm=Safe-VPL2026.050.90