ResearchBenchmarksSafe Reinforcement Learning on DSRL HardDenseFollow243.63RewardCDCP54.5476103.6363152.725201.8137Jul 4, 2026Evaluation ResultsMethodMethodLinksRewardCostCDCP2026.07243.6324.43CMTDiff2026.07170.4123.61CMTDD2026.0761.8220.09