Offline Reinforcement Learning on Atari 2600 Breakout Minari
71Average Episodic ReturnCQL
Evaluation Results
| Method | Links | |
|---|---|---|
| CQLOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 71 | |
| IQLOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 68 | |
| ERSAC-Ell-Epi*Offline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=3, Coverage parameter (υ)=0.92026.04 | 66 | |
| ERSAC-Ell-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=3, Coverage parameter (υ)=0.92026.04 | 64 | |
| ERSAC-CH-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 62 | |
| SAC-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 58 | |
| BRAC-BCQOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 35 |