Reinforcement Learning on Pong
40Average RewardAverage Human
Evaluation Results
| Method | Links | |
|---|---|---|
| Average Human2024.05 | 40 | |
| DDQN2024.05 | 19 | |
| FDQN2024.05 | 18 | |
| DQN2024.05 | 17 | |
| R2PONumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 2.51 | |
| ProPS+Number of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 1.22 | |
| PPONumber of runs=10, Aggregation protocol=averaged across all training iterations, Source=Best SB32026.05 | 1.02 | |
| ProPSNumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 0.74 |