Offline Safe Reinforcement Learning on DSRL MediumSparse
242.75RewardCDCP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CDCPMode=Multi-task2026.07 | 242.75 | 20.68 | |
| MTCOptiDICEMode=Multi-task2026.07 | 177.55 | 38.44 | |
| MTCDTMode=Multi-task2026.07 | 70.04 | 14.6 | |
| MTCPQMode=Multi-task2026.07 | -4.31 | 1.21 |