Offline Safe Reinforcement Learning on DSRL MediumDense
237.75RewardCDCP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CDCPMode=Multi-task2026.07 | 237.75 | 18.75 | |
| MTCOptiDICEMode=Multi-task2026.07 | 161.13 | 34.65 | |
| MTCDTMode=Multi-task2026.07 | 69.95 | 14.68 | |
| MTCPQMode=Multi-task2026.07 | -4.31 | 1.21 |