Worst-case time-constrained reinforcement learning on Walker MuJoCo (test)
1.69Normalized Worst-Case RewardStacked-TC-M2TD3
Evaluation Results
| Method | Links | |
|---|---|---|
| Stacked-TC-M2TD3Architecture=Stacked, Framework=TC2024.06 | 1.69 | |
| Oracle-TC-M2TD3Oracle=true, Framework=TC2024.06 | 1.49 | |
| TC-M2TD3Framework=TC2024.06 | 1.38 | |
| Oracle-TC-RARLOracle=true, Framework=TC2024.06 | 1.34 | |
| Oracle M2TD3Oracle=true2024.06 | 1.31 | |
| DRFramework=Domain Randomization2024.06 | 1.03 | |
| Stacked-TC-RARLArchitecture=Stacked, Framework=TC2024.06 | 1.01 | |
| M2TD3Framework=Robust2024.06 | 1 | |
| TC-RARLFramework=TC2024.06 | 0.89 | |
| RARLFramework=Robust2024.06 | 0.27 | |
| TD3Framework=Vanilla2024.06 | 0 | |
| Oracle RARLOracle=true2024.06 | -0.19 |