Constrained Reinforcement Learning on Humanoid
1,734.1Episodic RewardFOCOPS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FOCOPSCost Threshold=20, Number of Independent Runs=52025.12 | 1,734.1 | 19.7 | |
| P3OCost Threshold=20, Number of Independent Runs=52025.12 | 1,669.4 | 20.1 | |
| e-COPCost Threshold=20, Number of Independent Runs=52025.12 | 1,652.5 | 17.3 | |
| PCPOCost Threshold=20, Number of Independent Runs=52025.12 | 1,602.3 | 16.3 | |
| IPOCost Threshold=20, Number of Independent Runs=52025.12 | 1,578.6 | 19.1 | |
| APPOCost Threshold=20, Number of Independent Runs=52025.12 | 1,488.2 | 20 | |
| CPOCost Threshold=20, Number of Independent Runs=52025.12 | 1,465.1 | 18.5 | |
| PPO-LCost Threshold=20, Number of Independent Runs=52025.12 | 1,431.2 | 18.8 |