Reinforcement Learning on MinAtar 5M frames
52.7Mean ReturnQRC(λ) + SPR + Orthogonal Gradient Updates
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| QRC(λ) + SPR + Orthogonal Gradient UpdatesAlgorithm=qrc, SPR=Enabled, Orthogonal=Type 12026.02 | 52.7 | 39.91 | 43.13 | |
| QRC(λ) + SPRAlgorithm=qrc, SPR=Enabled2026.02 | 46.66 | 35.75 | 37.58 | |
| QRC(λ)Algorithm=qrc2026.02 | 42.5 | 29.01 | 33.94 | |
| Streaming DQN + SPRAlgorithm=dqn, SPR=Enabled2026.02 | 38.06 | 28.36 | 32.6 | |
| Stream Q(λ) + SPR + Orthogonal Gradient Updates v2Algorithm=strq, SPR=Enabled, Orthogonal=Type 22026.02 | 31.25 | 15.83 | 19.95 | |
| Stream Q(λ)Algorithm=strq2026.02 | 27.42 | 15.29 | 19.42 | |
| Streaming DQNAlgorithm=dqn2026.02 | 15.99 | 6.85 | 11.96 | |
| Stream Q(λ) + SPRAlgorithm=strq, SPR=Enabled2026.02 | 13.76 | 6.91 | 11.81 | |
| Stream Q(λ) + SPR + Orthogonal Gradient UpdatesAlgorithm=strq, SPR=Enabled, Orthogonal=Type 12026.02 | 12.86 | 6.87 | 10.84 |