ResearchDatasetsErgodic average-reward MDPsFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsFinding an ε-optimal policy from a single trajectoryErgodic average-reward MDPs-2Sample Complexity Exponent (vs ε)1
Finding an ε-optimal policy from a single trajectoryErgodic average-reward MDPs-2Sample Complexity Exponent (vs ε)1