Reinforcement Learning on DoorKey 6x6 (train)
0.744Mean Episodic ReturnL-SHADE
Evaluation Results
| Method | Links | |
|---|---|---|
| L-SHADECondition=Evolved2026.06 | 0.744 | |
| DECondition=Evolved2026.06 | 0.73 | |
| CMA-ESCondition=Evolved2026.06 | 0.714 | |
| xNESCondition=Evolved2026.06 | 0.672 | |
| Extrinsic onlyCondition=Baseline2026.06 | 0.668 |