ResearchBenchmarksSafe Reinforcement Learning on DSRL EasyMeanFollow324.41RewardCMTDiff-16.065272.3274160.72249.1126Jul 4, 2026Evaluation ResultsMethodMethodLinksRewardCostCMTDiff2026.07324.4140.07CDCP2026.07319.2824.68CDCPMode=Multi-taskMode=Multi-task2026.07319.2824.68MTCOptiDICEMode=Multi-taskMode=Multi-task2026.07233.3254.33MTCDTMode=Multi-taskMode=Multi-task2026.07162.3233.18CMTDD2026.0770.3623.61MTCPQMode=Multi-taskMode=Multi-task2026.07-2.970.33