Reinforcement Learning on Chain MDP
61.81Scaled Mean Cumulative RewardReversedQ
Evaluation Results
| Method | Links | |
|---|---|---|
| ReversedQPolicy=ReversedQ2026.05 | 61.81 | |
| RandomizedQ-InitPolicy=RandomizedQ-Init2026.05 | 46.95 | |
| RandomizedQ-BackwardPolicy=RandomizedQ-Backward2026.05 | 43.93 | |
| RandomizedQPolicy=RandomizedQ2026.05 | 21.76 | |
| RandomizedQ-UpdatePolicy=RandomizedQ-Update2026.05 | 20.67 |