Offline Safe Reinforcement Learning on DSRL HardMean
253.58RewardCDCP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CDCPMode=Multi-task2026.07 | 253.58 | 24.78 | |
| MTCOptiDICEMode=Multi-task2026.07 | 154.22 | 33.76 | |
| MTCDTMode=Multi-task2026.07 | 87.88 | 18.14 | |
| MTCPQMode=Multi-task2026.07 | -2.56 | 0.33 |