Reinforcement Learning on Atari 20 (final)
1.2193IQM ScoreNPG-FKL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| NPG-FKLactor entropy (τ)=enabled, critic entropy (ζ)=0, actor updates (n)=12025.09 | 1.2193 | 1.1603 | 1.2827 | |
| SPMA-RKLactor entropy (τ)=enabled, critic entropy (ζ)=0, actor updates (n)=12025.09 | 1.0529 | 0.9659 | 1.1561 | |
| Adam LMCDQN (Baseline)actor updates (n)=12025.09 | 1.0363 | 0.9423 | 1.1265 | |
| NPG-RKLactor entropy (τ)=enabled, critic entropy (ζ)=0, actor updates (n)=12025.09 | 1.0092 | 0.8784 | 1.143 | |
| SPMA-FKLactor entropy (τ)=enabled, critic entropy (ζ)=0, actor updates (n)=12025.09 | 1.0088 | 0.897 | 1.1301 | |
| DSACactor entropy (τ)=enabled, critic entropy (ζ)=0, actor updates (n)=12025.09 | 0.9226 | 0.8228 | 1.0288 | |
| DQN (Baseline)actor updates (n)=12025.09 | 0.7827 | 0.7563 | 0.8091 | |
| PPO (Baseline)actor updates (n)=12025.09 | 0.6835 | 0.6258 | 0.7311 |