Reinforcement Learning on Markov Decision Process (MDP)
1Sample Complexity[12]
Evaluation Results
| Method | Links | |
|---|---|---|
| [12]Sampling Model=generative/offline, Criteria=value function2024.02 | 1 | |
| [16]Sampling Model=generative/offline, Criteria=policy2024.02 | 1 | |
| [17]Sampling Model=generative/offline, Criteria=policy2024.02 | 1 | |
| [18]Sampling Model=generative/offline, Criteria=policy2024.02 | 1 | |
| [26]Sampling Model=episodic/online, Criteria=policy2024.02 | 1 | |
| SyncMBQSampling Model=i.i.d /online, Criteria=value function2024.02 | 1 | |
| [11]Sampling Model=episodic/online, Criteria=policy2024.02 | 2 | |
| [24]Sampling Model=episodic/online, Criteria=policy2024.02 | 2 | |
| [25]Sampling Model=episodic/online, Criteria=policy2024.02 | 2 | |
| [28]Sampling Model=episodic/online, Criteria=policy2024.02 | 2 |