Safe Reinforcement Learning on Reach (offline)
1.04Normalized RewardTask-Only
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Task-OnlyAlgorithm=Task-Only2026.05 | 1.04 | 1 | |
| OracleAlgorithm=Oracle2026.05 | 1 | 0.038 | |
| SOPLAlgorithm=Safety-Only Preference Learning2026.05 | 0.98 | 0.024 | |
| Safe-VPLAlgorithm=Safe-VPL2026.05 | 0.98 | 0.166 | |
| Safe-CPLAlgorithm=Safe-CPL2026.05 | 0.98 | 0.069 | |
| RCAlgorithm=Reward Combination, Safety trade-off weight (ω)=0.52026.05 | 0.83 | 0.101 |