Offline Safe Reinforcement Learning on DSRL HardDense
243.63RewardCDCP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CDCPMode=Multi-task2026.07 | 243.63 | 24.43 | |
| MTCOptiDICEMode=Multi-task2026.07 | 106.05 | 22.18 | |
| MTCDTMode=Multi-task2026.07 | 86.34 | 16.88 | |
| MTCPQMode=Multi-task2026.07 | -2.56 | 0.33 |