Reinforcement Learning on HalfCheetah stationary reward corruption (p=0.5) v4
61.59Final ReturnFull Meta-Cognitive
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Full Meta-CognitiveDescription=Trust recovery2026.01 | 61.59 | 104.72 | -26.29 | 20 | |
| Elastic-PPODescription=Adaptive LR2026.01 | 29.5 | 57.02 | -6.81 | 40 | |
| Sched-PPODescription=LR schedule2026.01 | 13.41 | 29.01 | -5.82 | 40 | |
| Base-PPODescription=TDVar2026.01 | -6.3 | 6.21 | -15.9 | 80 | |
| Fail-Safe (No Recovery)Description=Suppression only2026.01 | -43.91 | 113.13 | -242.04 | 60 |