Offline Safe Reinforcement Learning on DSRL EasySparse
326.06RewardCDCP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CDCPMode=Multi-task2026.07 | 326.06 | 25.21 | |
| MTCOptiDICEMode=Multi-task2026.07 | 242.81 | 57.44 | |
| MTCDTMode=Multi-task2026.07 | 175.75 | 36.97 | |
| MTCPQMode=Multi-task2026.07 | -2.97 | 0.33 |