Safe Reinforcement Learning on Ant-vel (offline)
1.23Normalized RewardTask-Only
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Task-OnlyAlgorithm=Task-Only2026.05 | 1.23 | 1 | |
| OracleAlgorithm=Oracle2026.05 | 1 | 0.002 | |
| SOPLAlgorithm=Safety-Only Preference Learning2026.05 | 0.98 | 0.007 | |
| Safe-VPLAlgorithm=Safe-VPL2026.05 | 0.9 | 0.001 | |
| RCAlgorithm=Reward Combination, Safety trade-off weight (ω)=0.52026.05 | 0.77 | 0.078 | |
| Safe-CPLAlgorithm=Safe-CPL2026.05 | 0.76 | 0.007 |