Reinforcement Learning on LunarLander v3 (Return Statistics and Performance Breakdown)
11,820,726Training StepsMF-AC
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| MF-ACSelection Criteria=peak, Checkpoint Epoch=760, Episode step horizon cap=1000-step2026.07 | 11,820,726 | 193.04 | -35.55 | 54 | 0 | 1 | |
| MPCSelection Criteria=smoothed best, World Model Checkpoint=WM 310, Episode step horizon cap=600-step2026.07 | 180,916 | 166.6 | -138.52 | 64 | 3 | 65.3 | |
| WM-ACSelection Criteria=CROF raw, World Model Checkpoint=WM 280, A2C Checkpoint Epoch=800, Episode step horizon cap=600-step2026.07 | 180,916 | 217.48 | -178.86 | 79 | 2 | 65.3 | |
| WM-ACSelection Criteria=CROF-A smooth, World Model Checkpoint=WM 315, A2C Checkpoint Epoch=800, Episode step horizon cap=600-step2026.07 | 180,916 | 178.01 | -203.47 | 63 | 1 | 65.3 |