Offline Safe Reinforcement Learning on DSRL MediumMean
236.57RewardCDCP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CDCPMode=Multi-task2026.07 | 236.57 | 19.65 | |
| MTCOptiDICEMode=Multi-task2026.07 | 173.61 | 37.42 | |
| MTCDTMode=Multi-task2026.07 | 72.95 | 15.31 | |
| MTCPQMode=Multi-task2026.07 | -4.31 | 1.21 |