Offline Reinforcement Learning on LunarLander Gym (100k)
107ReturnsERSAC-Ell-Epi
Evaluation Results
| Method | Links | |
|---|---|---|
| ERSAC-Ell-EpiDS=100k2026.04 | 107 | |
| ERSAC-Ell-Epi*DS=100k2026.04 | 106 | |
| ERSAC-Ell-NDS=100k, Tau aggregation=0.1, 0.5, 0.92026.04 | 104 | |
| ERSAC-CH-NDS=100k2026.04 | 100 | |
| SAC-NDS=100k2026.04 | 98 | |
| Behavior PolicyDS=100k2026.04 | 89 |