Reinforcement Learning on Taxi v3
452ReturnUniform Experience Replay
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Uniform Experience ReplayAlgorithm=DQN2026.05 | 452 | 7.91 | 200,000 | 264,000 | — | |
| NSERAlgorithm=DQN2026.05 | 428 | 6.32 | 199,000 | 179,000 | 1.04 | |
| Uniform Experience ReplayAlgorithm=QR-DQN2026.05 | 297 | 9.11 | 400,000 | 400,000 | — | |
| Uniform Experience ReplayAlgorithm=C512026.05 | 218 | 9.76 | 400,000 | 400,000 | — | |
| NSERAlgorithm=QR-DQN2026.05 | 207 | 8.78 | 398,000 | 398,000 | 1.19 | |
| NSERAlgorithm=C512026.05 | 187 | 8.81 | 398,000 | 398,000 | 1.13 |