Safety-Constrained Reinforcement Learning on Extended Chain CMDP (last 1,000 episodes)
0.069Jc2 Constraint MetricUnconstrained
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UnconstrainedBackbone=PPO2026.04 | 0.069 | 4.637 | |
| MC-CPOBackbone=PPO2026.04 | 1.098 | 2.592 | |
| Post-hocBackbone=PPO2026.04 | 3.626 | 3.626 |