Offline Safe Reinforcement Learning on DSRL EasyDense
316.47RewardCDCP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CDCPMode=Multi-task2026.07 | 316.47 | 24.39 | |
| MTCOptiDICEMode=Multi-task2026.07 | 208.75 | 47.19 | |
| MTCDTMode=Multi-task2026.07 | 155.48 | 30.82 | |
| MTCPQMode=Multi-task2026.07 | -2.97 | 0.33 |