Reinforcement Learning on Atari Human Normalized 100M frames
1.61Mean ReturnQRC(λ) + SPR + Orthogonal Gradient Updates
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| QRC(λ) + SPR + Orthogonal Gradient UpdatesAlgorithm=qrc, SPR=Enabled, Orthogonal=Type 12026.02 | 1.61 | 0.63 | 0.8 | |
| Stream Q(λ) + SPR + Orthogonal Gradient Updates v2Algorithm=strq, SPR=Enabled, Orthogonal=Type 22026.02 | 0.91 | 0.47 | 0.56 | |
| Stream Q(λ)Algorithm=strq2026.02 | 0.79 | 0.4 | 0.44 | |
| Streaming DQN + SPRAlgorithm=dqn, SPR=Enabled2026.02 | 0.75 | 0.47 | 0.51 | |
| Streaming DQNAlgorithm=dqn2026.02 | 0.59 | 0.24 | 0.32 | |
| QRC(λ)Algorithm=qrc2026.02 | 0.05 | 0.02 | 0.03 |