Offline Reinforcement Learning on Atari 2600 Q*bert Minari (fixed offline dataset)
66Average Episodic ReturnIQL
Evaluation Results
| Method | Links | |
|---|---|---|
| IQLOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 66 | |
| ERSAC-Ell-Epi*Offline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=3, Coverage parameter (υ)=0.92026.04 | 64 | |
| CQLOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 63 | |
| ERSAC-Ell-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=3, Coverage parameter (υ)=0.92026.04 | 62 | |
| ERSAC-CH-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 60 | |
| SAC-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 54 | |
| BRAC-BCQOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 29 |