ResearchBenchmarksSafe Reinforcement Learning on DSRL HardMeanFollow253.58RewardCDCP56.5208107.6804158.84209.9996Jul 4, 2026Evaluation ResultsMethodMethodLinksRewardCostCDCP2026.07253.5824.78CMTDiff2026.07223.8529.68CMTDD2026.0764.120.93