Global Convergence and Constraint Violation Analysis on Infinite-horizon RL Settings
1Global Convergence RateCayci et al.
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Cayci et al.Reward Setting=Discounted, Infinite State Action Space=✗, Mixing Time Unknown?=✓, Critic Parameterization=Multi layer NN, Policy Parameterization=Multi layer NN2026.03 | 1 | — | |
| Gaur et al.Reward Setting=Discounted, Infinite State Action Space=✓, Mixing Time Unknown?=✓, Critic Parameterization=Multi layer NN, Policy Parameterization=General2026.03 | 1 | — | |
| Ganesh et al.Reward Setting=Discounted, Infinite State Action Space=✓, Mixing Time Unknown?=✗, Critic Parameterization=Multi layer NN, Policy Parameterization=General2026.03 | 1 | — | |
| Mondal and AggarwalReward Setting=Discounted, Infinite State Action Space=✓, Mixing Time Unknown?=✓, Critic Parameterization=N/A, Policy Parameterization=General2026.03 | 1 | 1 | |
| Agarwal et al.Reward Setting=Average, Infinite State Action Space=✗, Mixing Time Unknown?=✗, Critic Parameterization=Tabular, Policy Parameterization=Tabular2026.03 | 1 | 0 | |
| Ghosh et al.Reward Setting=Average, Infinite State Action Space=✓, Mixing Time Unknown?=✗, Critic Parameterization=Linear MDP, Policy Parameterization=Tabular2026.03 | 1 | 1 | |
| Bai et al.Reward Setting=Average, Infinite State Action Space=✓, Mixing Time Unknown?=✗, Critic Parameterization=N/A, Policy Parameterization=General2026.03 | 1 | 1 | |
| Xu et al.Reward Setting=Average, Infinite State Action Space=✓, Mixing Time Unknown?=✓, Critic Parameterization=Linear, Policy Parameterization=General2026.03 | 1 | 1 | |
| PDNAC-NCReward Setting=Average, Infinite State Action Space=✓, Mixing Time Unknown?=✓, Critic Parameterization=Multi layer NN, Policy Parameterization=General2026.03 | 1 | 1 |