Offline Reinforcement Learning on Atari 2600 Pong Minari
86Average Episodic ReturnCQL
Evaluation Results
| Method | Links | |
|---|---|---|
| CQLOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 86 | |
| IQLOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 84 | |
| ERSAC-Ell-Epi*Offline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=3, Coverage parameter (υ)=0.92026.04 | 83 | |
| ERSAC-Ell-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=3, Coverage parameter (υ)=0.92026.04 | 82 | |
| ERSAC-CH-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 80 | |
| SAC-NOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 78 | |
| BRAC-BCQOffline training=true, Deterministic evaluation=true, Evaluation episodes=100, Random seeds=32026.04 | 55 |