Reinforcement Learning on Nim (Mean reward)
0.61Mean RewardR2PO
Evaluation Results
| Method | Links | |
|---|---|---|
| R2PONumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 0.61 | |
| ProPSNumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 0.59 | |
| ProPS+Number of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 0.25 | |
| A2CNumber of runs=10, Aggregation protocol=averaged across all training iterations, Source=Best SB32026.05 | 0.01 |