Offline Safe Reinforcement Learning on DSRL HardSparse
257.98RewardCDCP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CDCPMode=Multi-task2026.07 | 257.98 | 24.94 | |
| MTCOptiDICEMode=Multi-task2026.07 | 147.62 | 32.66 | |
| MTCDTMode=Multi-task2026.07 | 94.26 | 19.57 | |
| MTCPQMode=Multi-task2026.07 | -2.56 | 0.33 |