Offline Reinforcement Learning on Synthetic continuous control task (20 evaluation episodes)
2,578.5Average ReturnQuantum DT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Quantum DTParameters=1,598,3482025.12 | 2,578.5 | 956.24 | 0.0156 | |
| DT + Q-FFParameters=1,927,4362025.12 | 34.46 | 252.75 | 0.0276 | |
| Standard DTParameters=742,0192025.12 | -133.88 | 447.73 | 0.037 | |
| DT + Q-AttentionParameters=791,5552025.12 | -2,447.12 | 1,508.64 | 0.0122 |