Reinforcement Learning on Atari Human Normalized 40M frames
1.25Mean ReturnQRC(λ) + SPR + Orthogonal Gradient Updates
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| QRC(λ) + SPR + Orthogonal Gradient UpdatesAlgorithm=qrc, SPR=Enabled, Orthogonal=Type 12026.02 | 1.25 | 0.5 | 0.62 | |
| QRC(λ) + SPRAlgorithm=qrc, SPR=Enabled2026.02 | 1.13 | 0.46 | 0.61 | |
| Stream Q(λ) + SPR + Orthogonal Gradient Updates v2Algorithm=strq, SPR=Enabled, Orthogonal=Type 22026.02 | 0.61 | 0.32 | 0.37 | |
| Stream Q(λ)Algorithm=strq2026.02 | 0.48 | 0.15 | 0.23 | |
| Streaming DQN + SPRAlgorithm=dqn, SPR=Enabled2026.02 | 0.35 | 0.19 | 0.22 | |
| Streaming DQNAlgorithm=dqn2026.02 | 0.29 | 0.1 | 0.12 | |
| Stream Q(λ) + SPRAlgorithm=strq, SPR=Enabled2026.02 | 0.28 | 0.11 | 0.13 | |
| Stream Q(λ) + SPR + Orthogonal Gradient UpdatesAlgorithm=strq, SPR=Enabled, Orthogonal=Type 12026.02 | 0.24 | 0.08 | 0.12 | |
| QRC(λ)Algorithm=qrc2026.02 | 0.04 | 0.02 | 0.03 |