Safe Reinforcement Learning on HalfCheetah vel (offline)
1.85Normalized RewardTask-Only
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Task-OnlyAlgorithm=Task-Only2026.05 | 1.85 | 1 | |
| OracleAlgorithm=Oracle2026.05 | 1 | 0 | |
| Safe-VPLAlgorithm=Safe-VPL2026.05 | 0.96 | 0.004 | |
| SOPLAlgorithm=Safety-Only Preference Learning2026.05 | 0.93 | 0.014 | |
| Safe-CPLAlgorithm=Safe-CPL2026.05 | 0.92 | 0.018 | |
| RCAlgorithm=Reward Combination, Safety trade-off weight (ω)=0.52026.05 | 0.44 | 0.107 |