Policy Gradient Optimization on First-order stationary point convergence (||∇J(θ)||^2 ≤ ε)
1Memory Usage (#Trajectories)REINFORCE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| REINFORCEData reused=—, Storage of old policies=✗, Regular policies=✓, Bounded IW variance=✗2025.06 | 1 | — | |
| PGTData reused=—, Storage of old policies=✗, Regular policies=✓, Bounded IW variance=✗2025.06 | 1 | — | |
| GPOMDPData reused=—, Storage of old policies=✗, Regular policies=✓, Bounded IW variance=✗2025.06 | 1 | — | |
| SVRPGData reused=Gradients, Storage of old policies=✓, Regular policies=✓, Bounded IW variance=✓2025.06 | 1 | — | |
| SRVRPGData reused=Gradients, Storage of old policies=✓, Regular policies=✓, Bounded IW variance=✓2025.06 | 1 | — | |
| STORM-PGData reused=Gradients, Storage of old policies=✓, Regular policies=✓, Bounded IW variance=✓2025.06 | 1 | — | |
| PAGE-PGData reused=Gradients, Storage of old policies=✓, Regular policies=✓, Bounded IW variance=✓2025.06 | 1 | — | |
| DEF-PGData reused=Gradients, Storage of old policies=✓, Regular policies=✓, Bounded IW variance=✗2025.06 | 1 | — |