ResearchBenchmarksSafe Reinforcement Learning on Run (offline)Follow1Normalized RewardOracle0.9480.96150.9750.9885May 20, 2026Evaluation ResultsMethodMethodLinksNormalized RewardNormalized CostOracleAlgorithm=OracleAlgorithm=Oracle2026.0510Task-OnlyAlgorithm=Task-OnlyAlgorithm=Task-Only2026.0511RCAlgorithm=Reward Combi...Algorithm=Reward Combination, Safety trade-off weight (ω)=0.52026.0510SOPLAlgorithm=Safety-Only...Algorithm=Safety-Only Preference Learning2026.050.990Safe-CPLAlgorithm=Safe-CPLAlgorithm=Safe-CPL2026.050.970Safe-VPLAlgorithm=Safe-VPLAlgorithm=Safe-VPL2026.050.950