Safe Reinforcement Learning on Swimmer-vel (offline)
2.39Normalized RewardTask-Only
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Task-OnlyAlgorithm=Task-Only2026.05 | 2.39 | 1 | |
| SOPLAlgorithm=Safety-Only Preference Learning2026.05 | 1.34 | 0.014 | |
| OracleAlgorithm=Oracle2026.05 | 1 | 0 | |
| Safe-CPLAlgorithm=Safe-CPL2026.05 | 0.99 | 0.005 | |
| Safe-VPLAlgorithm=Safe-VPL2026.05 | 0.88 | 0.001 | |
| RCAlgorithm=Reward Combination, Safety trade-off weight (ω)=0.52026.05 | 0.83 | 0 |