Reinforcement Learning on Octax 20M frames
52.75Mean ReturnQRC(λ) + SPR + Orthogonal Gradient Updates
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| QRC(λ) + SPR + Orthogonal Gradient UpdatesAlgorithm=qrc, SPR=Enabled, Orthogonal=Type 12026.02 | 52.75 | 8.36 | 23.16 | |
| Streaming DQN + SPRAlgorithm=dqn, SPR=Enabled2026.02 | 52.46 | 6.4 | 22.58 | |
| QRC(λ) + SPRAlgorithm=qrc, SPR=Enabled2026.02 | 48.65 | 7.72 | 19.05 | |
| Streaming DQNAlgorithm=dqn2026.02 | 47.41 | 5.11 | 14.65 | |
| QRC(λ)Algorithm=qrc2026.02 | 38.78 | 7.14 | 12.52 | |
| Stream Q(λ) + SPR + Orthogonal Gradient Updates v2Algorithm=strq, SPR=Enabled, Orthogonal=Type 22026.02 | 26.68 | 3.29 | 13.35 | |
| Stream Q(λ) + SPRAlgorithm=strq, SPR=Enabled2026.02 | 16.7 | 0.45 | 1.06 | |
| Stream Q(λ)Algorithm=strq2026.02 | 16.43 | 2.82 | 5.98 | |
| Stream Q(λ) + SPR + Orthogonal Gradient UpdatesAlgorithm=strq, SPR=Enabled, Orthogonal=Type 12026.02 | 5.57 | 0.43 | 0.74 |