Offline Reinforcement Learning on Atari 2600 Hero Minari
58Average Episodic ReturnERSAC-Ell-Epi*
Evaluation Results
| Method | Links | |
|---|---|---|
| ERSAC-Ell-Epi*Offline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=3, Coverage parameter (υ)=0.92026.04 | 58 | |
| IQLOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 56 | |
| ERSAC-Ell-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=3, Coverage parameter (υ)=0.92026.04 | 55 | |
| CQLOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 52 | |
| ERSAC-CH-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 50 | |
| SAC-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 38 | |
| BRAC-BCQOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 22 |