Constrained Reinforcement Learning on AntCircle
198.6Episodic Rewarde-COP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| e-COPCost Threshold=10, Number of Independent Runs=52025.12 | 198.6 | 9.8 | |
| P3OCost Threshold=10, Number of Independent Runs=52025.12 | 182.6 | 9.8 | |
| PCPOCost Threshold=10, Number of Independent Runs=52025.12 | 168.3 | 9.5 | |
| FOCOPSCost Threshold=10, Number of Independent Runs=52025.12 | 161.9 | 9.9 | |
| APPOCost Threshold=10, Number of Independent Runs=52025.12 | 155.5 | 10 | |
| IPOCost Threshold=10, Number of Independent Runs=52025.12 | 149.3 | 9.5 | |
| PPO-LCost Threshold=10, Number of Independent Runs=52025.12 | 134.4 | 9.6 | |
| CPOCost Threshold=10, Number of Independent Runs=52025.12 | 127.1 | 10.1 |