Reinforcement Learning on KeyCorridor S3R1 (train)
0.902Mean Episodic ReturnCMA-ES
Evaluation Results
| Method | Links | |
|---|---|---|
| CMA-ESCondition=Evolved2026.06 | 0.902 | |
| Extrinsic onlyCondition=Baseline2026.06 | 0.871 | |
| xNESCondition=Evolved2026.06 | 0.755 | |
| L-SHADECondition=Evolved2026.06 | 0.266 | |
| DECondition=Evolved2026.06 | 0.266 |