Offline Reinforcement Learning on CartPole 100k Gym
100ReturnsSAC-N
Evaluation Results
| Method | Links | |
|---|---|---|
| SAC-NDS=100k2026.04 | 100 | |
| ERSAC-CH-NDS=100k2026.04 | 100 | |
| ERSAC-Ell-NDS=100k, Tau aggregation=0.1, 0.5, 0.92026.04 | 100 | |
| ERSAC-Ell-EpiDS=100k2026.04 | 100 | |
| ERSAC-Ell-Epi*DS=100k2026.04 | 100 | |
| Behavior PolicyDS=100k2026.04 | 90 |