Offline Safe Reinforcement Learning on DSRL Mean
270.45RewardCDCP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CDCPMode=Multi-task2026.07 | 270.45 | 23.06 | |
| MTCOptiDICEMode=Multi-task2026.07 | 178.34 | 39.79 | |
| MTCDTMode=Multi-task2026.07 | 108.33 | 22.24 | |
| MTCPQMode=Multi-task2026.07 | -2.62 | 0.62 |