Probability of Correct Selection on Stochastic Gridworld (S=16, A=4)
100PCSLazyGradient
Evaluation Results
| Method | Links | |
|---|---|---|
| LazyGradientSampling budget (T)=10002026.05 | 100 | |
| LazyGradientSampling budget (T)=12002026.05 | 100 | |
| QOCBASampling budget (T)=10002026.05 | 92 | |
| QOCBASampling budget (T)=12002026.05 | 92 | |
| LazyGradientSampling budget (T)=8002026.05 | 92 | |
| LazyGradientSampling budget (T)=6002026.05 | 78 | |
| QOCBASampling budget (T)=8002026.05 | 70 | |
| PSRLSampling budget (T)=12002026.05 | 56 | |
| QOCBASampling budget (T)=6002026.05 | 46 | |
| PSRLSampling budget (T)=10002026.05 | 38 | |
| Actor-CriticSampling budget (T)=12002026.05 | 26 | |
| PSRLSampling budget (T)=8002026.05 | 18 | |
| Q-LearningSampling budget (T)=12002026.05 | 16 | |
| PPOSampling budget (T)=12002026.05 | 16 | |
| Q-LearningSampling budget (T)=10002026.05 | 12 | |
| PPOSampling budget (T)=10002026.05 | 10 | |
| Actor-CriticSampling budget (T)=10002026.05 | 8 | |
| Q-LearningSampling budget (T)=6002026.05 | 4 | |
| TRPOSampling budget (T)=12002026.05 | 4 | |
| Q-LearningSampling budget (T)=8002026.05 | 2 | |
| Actor-CriticSampling budget (T)=6002026.05 | 2 | |
| Actor-CriticSampling budget (T)=8002026.05 | 2 | |
| PSRLSampling budget (T)=6002026.05 | 2 | |
| PPOSampling budget (T)=6002026.05 | 0 | |
| PPOSampling budget (T)=8002026.05 | 0 | |
| TRPOSampling budget (T)=6002026.05 | 0 | |
| TRPOSampling budget (T)=8002026.05 | 0 | |
| TRPOSampling budget (T)=10002026.05 | 0 |